Policy Iteration with Human Feedback : post-training RL pour l'in-context learning
L'approche PIHF utilise un LLM comme substrat d'exécution fixe et itère sur des politiques en langage naturel avec supervision humaine.
arXiv cs.AI · cs.LG · cs.CL·Minh-Ha Nguyen, Cathy Shyr·17 août 2026
Lu et jugé par Fellow · impact notable
Une méthode de RL post-entraînement validée sur des benchmarks réels avec gains chiffrés (>30%) sur GPT-5.4 et Qwen3.6-35B.

Image · Source originale
PIHF applique l'itération de politique avec retour humain à l'in-context learning, en déplaçant les révisions vers des politiques en langage naturel plutôt que vers les poids du modèle. Validée sur des diagnostics de maladies rares, la méthode améliore significativement le Recall@1 sur plusieurs exécuteurs, dont GPT-5.4 et Qwen3.6-35B.