llama.cpp: Motor de inferencia local rápido para DeepSeek-R1 y modelos cuantizados
Un motor de inferencia de LLM en C++ de alto rendimiento compatible con cuantización de pocos bits y ejecución eficiente de modelos de razonamiento en Apple Silicon y hardware estándar.
Imagen: GitHub




