Faire tourner Qwen 3.8 Flash Next (125B) sur du matériel grand public (RTX 4090) à 100 T/s
Un projet open source promet d'exécuter un modèle de 125 milliards de paramètres sur une seule RTX 4090, à haute vitesse.
Hacker News (filtré IA)·@snehesht·4 octobre 2026

Image · Source originale
Le projet Strata, publié sur GitHub, annonce la possibilité de faire tourner le modèle Qwen 3.8 Flash Next (125B paramètres) sur une carte grand public RTX 4090, avec un débit annoncé de 100 tokens par seconde. L'outil viserait à démocratiser l'inférence de grands modèles sur du matériel accessible.