SGLang : Cadre d'exécution et de service LLM structuré
Un cadre d'exécution rapide pour les pipelines d'agents LLM complexes à plusieurs tours utilisant RadixAttention pour la réutilisation automatique du cache KV et le décodage structuré.
Image: GitHub



