SGLang: Marco de ejecución y servicio estructurado para LLM
Un marco de ejecución rápido para complejos pipelines de agentes LLM de múltiples turnos, que utiliza RadixAttention para la reutilización automática de la caché KV y la decodificación estructurada.
Imagen: GitHub



