llama.cpp : Moteur d'inférence locale rapide pour DeepSeek-R1 et modèles quantifiés
Un moteur d'inférence LLM haute performance en C++ prenant en charge la quantification à faible précision et l'exécution efficace de modèles de raisonnement sur Apple Silicon et matériel standard.
Image: GitHub




