Sortie de llama.cpp v0.1.0
Georgi Gerganov publie la version initiale de llama.cpp, portant l'inférence LLM sur CPU.
Hacker News (filtré IA)·@satvikpendem·17 août 2026
Lu et jugé par Fellow · impact majeur
Première version d'un outil standard permettant l'inférence LLM sur CPU grand public par quantization.

Image · Source originale
La version v0.1.0 de llama.cpp est publiée, marquant le début du projet. Cette bibliothèque permet l'inférence de modèles LLaMA sur CPU via quantisation 4-bit, rendant les grands modèles accessibles sur matériel grand public sans GPU dédié.