RECHERCHE
Persian Pixel : un jeu de données OCR synthétique à grande échelle pour le persan
Un nouveau corpus de 343 000 paires image-texte vise à combler le retard de l'OCR pour la langue persane, complexe et sous-dotée en données.
arXiv cs.AI · cs.LG · cs.CL·Pouria Mahdi, Haq Nawaz Malik·22 juillet 2026

Image · Source originale
Persian Pixel est un dataset synthétique comprenant plus de 343 000 paires image-texte, générées à partir d'un corpus de sept millions de mots via le framework SynthOCR-Gen. Il couvre phrases, paragraphes et pages entières, en modélisant les spécificités typographiques du persan (cursivité, ligatures, diacritiques, styles Naskh et Nastaliq). L'objectif est de pallier le manque de données annotées de qualité pour l'OCR en écriture perso-arabe.