Toutes les news taguées avec ce sujet.
Un nouveau corpus de 343 000 paires image-texte vise à combler le retard de l'OCR pour la langue persane, complexe et sous-dotée en données.
Le laboratoire français Pleias met à disposition une collection massive de textes libres de droits destinée à l'entraînement de modèles de langage.
Un nouveau jeu de données combine vidéos et fils de commentaires TikTok pour étudier les prises de position politiques lors de l'élection américaine de 2024.
Un benchmark pour le cold-start avec un nouveau dataset contrôlé et privé.
Un vaste corpus multilingue pour l'entraînement de modèles IA.
Le laboratoire français dévoile un corpus de données synthétiques destiné à l'entraînement de modèles de langage, disponible sur Hugging Face.
Le laboratoire français Pleias met en ligne sur Hugging Face un ensemble de jeux de données et modèles orientés finance.
Le lab européen Pleias met en ligne SYNTH, une collection Hugging Face de jeux de données synthétiques destinés à l'entraînement de modèles.
Le laboratoire français Pleias met à disposition Common Corpus, une collection massive de textes libres de droits pour entraîner des LLM.
Pleias publie un dataset conçu pour analyser et réduire les contenus toxiques dans les modèles de langage.
Publication d'annotations détaillées pour le benchmark HellaSwag par Pleias.
Le laboratoire français Pleias met en ligne GoldenSwag sur Hugging Face, sans détails contextuels supplémentaires disponibles.
Le lab français Pleias met en ligne CommonLingua sur Hugging Face, une ressource destinée à l'entraînement de modèles de langage.
Un nouveau benchmark de 572 segments de pop music avec MIDI multitrack pour évaluer les modèles de transcription automatique.
NVIDIA et Hugging Face s'associent pour publier des datasets ouverts dédiés à l'entraînement d'agents IA autonomes.
Des chercheurs publient NAICS-GH, un corpus de 6 588 dépôts GitHub étiquetés par secteur industriel avec 97 % de précision.