OUTILS · Pleias
Pleias publie Common Corpus, un vaste jeu de données ouvert pour l'entraînement de LLM
Le laboratoire français Pleias met à disposition une collection massive de textes libres de droits destinée à l'entraînement de modèles de langage.
Pleias (Hugging Face)·13 novembre 2024

Image · Source originale
Common Corpus est une collection de données textuelles publiée par Pleias sur Hugging Face, composée de contenus dans le domaine public ou sous licences ouvertes. Elle vise à fournir une alternative transparente et légalement sûre aux corpus d'entraînement traditionnels des LLM, souvent opaques sur leurs sources.