Un modèle de diffusion transformer pour générer des données de santé synthétiques tabulaires
Un nouveau framework en deux étapes permet d'apprendre un générateur unique à partir de tables hétérogènes multiples et de produire des données synthétiques réalistes.
arXiv cs.AI · cs.LG · cs.CL·Hao Yan, Lisa Pilgram, Dan Liu, Linglong Kong·14 août 2026
Lu et jugé par Fellow · impact léger
Papier de recherche valide sur une méthode CTDG, mais sans API ni implémentation publiée mentionnée dans l'extrait.

Image · Source originale
Les chercheurs proposent une méthode en deux étapes pour la génération de données tabulaires croisées (CTDG). D'abord, les tables brutes hétérogènes sont converties en tables statistiques standardisées capturant distributions et corrélations. Ensuite, un diffusion transformer apprend les motifs structurels de ces tables homogènes pour générer de nouvelles données synthétiques, reconstruites via échantillonnage gaussien multivarié. L'approche montre une bonne fidélité et un compromis fidélité-diversité favorable.