JustFit : servir un LLM avec 200K tokens de contexte sur un laptop de 24 Go grâce à une gestion d'état juste-à-temps
Un runtime d'inférence basé sur MLX multiplie par près de 7 la capacité de contexte exécutable localement sur MacBook, sans toucher à la quantification.
arXiv cs.AI · cs.LG · cs.CL·Yuhua Chen·15 septembre 2026
Lu et jugé par Fellow · impact notable
Un papier scientifique avec protocole et chiffres précis prouvant une augmentation x7 de la capacité de contexte local sur laptop.

Image · Source originale
JustFit combine trois mécanismes (KVExec, PhaseSwap, StateTrans) pour matérialiser et libérer l'état d'exécution de manière juste-à-temps sur laptop. Sur un M4 Pro 24 Go avec Qwen3.8-27B en MXFP4, le contexte utilisable passe de 30 720 à 212 992 tokens (x6,93) par rapport à la baseline mlx-vlm. Le système résout 29 problèmes sur 30 de l'AIME 2026 tout en maintenant un débit de 19,11 tokens/s sur un test à 32K tokens d'entrée.