Les LLM peinent avec le tiret long
L'analyse des erreurs de tokenisation révèle des lacunes récurrentes dans le traitement de la ponctuation par l'IA.
Hacker News (filtré IA)·@speckx·24 août 2026
Lu et jugé par Fellow · impact bruit
Billet d'opinion personnel sans analyse technique de tokenisation ni données vérifiables sur le comportement des LLM.
Pourquoi ce titre est à nuancer
Le titre FR affirme une analyse technique de tokenisation alors que le corps est une opinion sur la perception sociale des em dashes.

Image · Source originale
Un billet technique démontre que les difficultés rencontrées par les LLM avec le tiret long (em dash) proviennent d'une tokenisation inadaptée. L'auteur explique comment ce défaut de segmentation affecte la cohérence des réponses et suggère que le problème réside moins dans la grammaire que dans l'architecture des modèles.