DeepSeek-V3: Modelo de Lenguaje MoE de 671B para Código y Razonamiento
DeepSeek-V3 es un modelo Mixture-of-Experts de pesos abiertos. Está entrenado con Multi-head Latent Attention y la arquitectura DeepSeekMoE, compitiendo con los principales modelos propietarios en los benchmarks de codificación.
Imagen: GitHub




