DeepSeek-V4
Descrição
O modelo principal de 4ª geração da DeepSeek. V4-Pro (1.6T MoE) e V4-Flash (284B MoE) oferecem contexto de 1M, multimodalidade nativa e Hybrid Attention para eficiência extrema.
Ferramentas relacionadas
DeepSeek-R1
Os modelos de raciocínio de primeira geração da DeepSeek, DeepSeek-R1-Zero e DeepSeek-R1. DeepSeek-R1-Zero, um modelo treinado por meio de aprendizado por reforço (RL) em larga escala sem ajuste fino supervisionado (SFT) como etapa preliminar, demonstrou desempenho notável em raciocínio.
DeepSeek-V3
Um poderoso modelo de linguagem Mixture-of-Experts (MoE) com 671B parâmetros no total, com 37B ativados para cada token.
Llama 3
Llama3 é um grande modelo de linguagem desenvolvido pela Meta AI. É o sucessor do modelo de linguagem Llama2 da Meta.<br>Endereço de teste online:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Um grande modelo de linguagem de código aberto criado pela xAI
Phi-3
Phi-3 é uma família de modelos de IA abertos desenvolvida pela Microsoft. Os modelos Phi-3 são os pequenos modelos de linguagem (SLM) mais capazes e econômicos disponíveis, superando modelos do mesmo tamanho e do próximo tamanho em vários benchmarks de linguagem, raciocínio, codificação e matemática.
Gemma 4
Gemma 4 é a mais recente série de modelos de linguagem de código aberto do Google, construída sobre a arquitetura Gemini, oferecendo desempenho aprimorado, janelas de contexto mais longas e melhor suporte multilíngue.