DeepSeek-R1

Categoría:Open Source LLMsPrecios: Gratis

Descripción

Los modelos de razonamiento de primera generación de DeepSeek, DeepSeek-R1-Zero y DeepSeek-R1. DeepSeek-R1-Zero, un modelo entrenado mediante aprendizaje por refuerzo (RL) a gran escala sin ajuste fino supervisado (SFT) como paso preliminar, demostró un rendimiento notable en el razonamiento.