Toutes les news taguées avec ce sujet.
Un article technique détaille une optimisation du prompt lookup decoding, une méthode de génération accélérée dans llama.cpp.