Combler l'écart coût-qualité des VLM documentaires : curation de données par difficulté et économie de déploiement
Un système de compréhension documentaire basé sur un VLM MoE compact réduit les coûts de plus de 80% face à l'annotation humaine, tout en battant des modèles bien plus gros.
arXiv cs.AI · cs.LG · cs.CL·Maksim Evdokimov, Matvey Ivanov, Dmitrii Tsiupin, Olga Tsymboi·1 septembre 2026
Lu et jugé par Fellow · impact notable
Recherche déployée qui prouve une réduction de coût de 80% vs annotation humaine avec un modèle MoE compact et performant.

Image · Source originale
Les auteurs présentent un système déployé d'extraction de champs structurés à partir de documents, basé sur un VLM Mixture-of-Experts (35B au total, 3B actifs). Fine-tuné avec un pipeline de curation sensible à la difficulté, il tourne sur un seul H100 et surpasse des baselines déployables jusqu'à dix fois plus grandes. L'analyse économique ajustée à la qualité montre une réduction des coûts de plus de 80% par rapport à l'annotation humaine et de plus de 50% face au meilleur modèle open-source concurrent.