Apprendre une frontière taille-poids pour l'inférence augmentée par données synthétiques
Un cadre statistique permet d'exploiter des données synthétiques (dont celles générées par LLM) sans compromettre la fiabilité de l'inférence.
arXiv cs.AI · cs.LG · cs.CL·Chengpiao Huang, Kaizheng Wang·28 août 2026
Lu et jugé par Fellow · impact léger
Contribution méthodologique statistique incrémentale, testée sur un seul type d'application, sans large validation externe.

Image · Source originale
Des chercheurs proposent un cadre général pour intégrer des données synthétiques à l'inférence statistique sans introduire de biais. Leur méthode définit une frontière optimale entre nombre d'observations synthétiques et leur poids, garantissant une couverture statistique fiable. Testée sur des réponses de LLM augmentant des sondages d'opinion, l'approche atteint la couverture cible tout en réduisant significativement les intervalles de confiance.