DeepSeek-R1: Modelos de razonamiento abiertos mediante aprendizaje por refuerzo masivo
Un modelo de razonamiento de código abierto entrenado con aprendizaje por refuerzo que genera cadenas de pensamiento extendidas, igualando a modelos propietarios en programación competitiva.
Imagen: GitHub




