DeepSeek-V4
Descripción
El modelo insignia de cuarta generación de DeepSeek. V4-Pro (1.6T MoE) y V4-Flash (284B MoE) cuentan con un contexto de 1M, multimodalidad nativa y Hybrid Attention para una eficiencia extrema.
Herramientas relacionadas
DeepSeek-R1
Los modelos de razonamiento de primera generación de DeepSeek, DeepSeek-R1-Zero y DeepSeek-R1. DeepSeek-R1-Zero, un modelo entrenado mediante aprendizaje por refuerzo (RL) a gran escala sin ajuste fino supervisado (SFT) como paso preliminar, demostró un rendimiento notable en el razonamiento.
DeepSeek-V3
Un potente modelo de lenguaje Mixture-of-Experts (MoE) con 671B parámetros totales, con 37B activados para cada token.
Llama 3
Llama3 es un gran modelo de lenguaje desarrollado por Meta AI. Es el sucesor del modelo de lenguaje Llama2 de Meta.<br>Dirección de prueba en línea:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Un gran modelo de lenguaje de código abierto creado por xAI
Phi-3
Phi-3 es una familia de modelos de IA abiertos desarrollada por Microsoft. Los modelos Phi-3 son los pequeños modelos de lenguaje (SLM) más capaces y rentables disponibles, superando a los modelos del mismo tamaño y del siguiente tamaño en una variedad de pruebas de referencia de lenguaje, razonamiento, codificación y matemáticas.
Gemma 4
Gemma 4 es la última serie de modelos de lenguaje de código abierto de Google, construida sobre la arquitectura Gemini, que ofrece rendimiento mejorado, ventanas de contexto más largas y mejor soporte multilingüe.