RECHERCHE
Au-delà de l'échelle et de la génération : comprendre l'entity matching avec des modèles de langage
Une étude factorielle contrôlée de 1 215 runs isole l'effet de l'architecture, de la variante et de la taille des modèles sur l'entity matching.
arXiv cs.AI · cs.LG · cs.CL·Zeyu Zhang, Xue Li, Iacer Calixto, Paul Groth·27 juillet 2026

Image · Source originale
Les chercheurs comparent bi-encoders, cross-encoders et matchers génératifs issus de la famille Qwen3, sur neuf datasets. Les variantes orientées embedding favorisent les bi-encoders, tandis que les cross-encoders gardent un avantage grâce à l'encodage joint des paires. Les matchers génératifs excellent surtout en cas de distribution shift, et les modèles plus grands montrent une dépendance accrue au shortcut learning.