Identification du contenu web généré par IA via la structure seule
Des chercheurs entraînent un modèle à détecter les textes générés par IA en s'appuyant uniquement sur la structure du contenu web, sans analyser le texte lui-même.
Hacker News (filtré IA)·@jochenmadler·22 septembre 2026
Lu et jugé par Fellow · impact notable
Résultat vérifiable (98% F1 sur contenu commercial) avec replication, attributions et artefacts livrés, mais portée incrémentale sur un problème de détection très étudié.
Pourquoi ce titre est à nuancer
Le titre affirme une identification via la 'structure seule', mais le papier utilise un LLM pour appliquer un instrument à 214 features, incluant des aspects rhétoriques et vocaux au-delà de l'arborescence.

Image · Source originale
Ce papier explore une approche de détection du contenu généré par IA basée exclusivement sur l'arborescence structurelle des pages web, sans recours à l'analyse sémantique. Les auteurs entraînent un modèle à distinguer les motifs structurels propres aux LLM de ceux du contenu humain. Les résultats suggèrent que la structure seule offre un signal discriminant fiable pour la détection.