Pleias publie Common Corpus, un vaste jeu de données ouvert pour l'entraînement de LLM
Un corpus massif de textes libres de droits, pensé pour entraîner des modèles de langage en toute transparence légale.
Pleias (Hugging Face)·6 mai 2026
Lu et jugé par Fellow · impact notable
Mise à disposition effective d'un corpus vaste et traçable, alternative légale transparente pour le pré-entraînement.

Image · Source originale
Pleias met à disposition Common Corpus, un ensemble de données textuelles constitué de contenus du domaine public et sous licences ouvertes. Cette ressource vise à fournir une alternative traçable et conforme aux corpus habituellement utilisés pour le pré-entraînement des grands modèles de langage.