Inférence LLM distribuée sur flottes de PC IA Intel via des shards de pipeline précompilés
Des chercheurs Intel montrent comment plusieurs PC IA modestes peuvent faire tourner ensemble un LLM 70B via du parallélisme pipeline optimisé.
arXiv cs.AI · cs.LG · cs.CL·Tate Berenbaum, Muthaiah Venkatachalam·19 août 2026
Lu et jugé par Fellow · impact notable
Code et benchmarks fournis prouvant que des PC IA grand public peuvent faire tourner un LLM 70B à vitesse interactive via du parallélisme pipeline.

Image · Source originale
Les PC IA Intel disposent de GPU intégrés et NPU avec 16+ Go de mémoire unifiée, insuffisants pour un LLM 70B seul. Les auteurs proposent de découper le modèle en shards par couche, précompilés en graphes OpenVINO, avec des optimisations (fusion IndirectKVCache, decoding spéculatif, micro-batching) pour retrouver les performances d'un modèle non fragmenté. Un pipeline à deux nœuds Llama 3.1 8B INT4 atteint 1,79x le débit mono-utilisateur, et un déploiement à quatre nœuds fait tourner un modèle 70B à vitesse interactive.