DeepSeek-V3: نموذج لغوي MoE بحجم 671B للكود والاستنتاج
DeepSeek-V3 هو نموذج مفتوح الأوزان من نوع Mixture-of-Experts. تم تدريبه باستخدام تقنية Multi-head Latent Attention وهندسة DeepSeekMoE، وينافس أفضل النماذج الاحتكارية في معايير الترميز.
صورة: GitHub




