Mixtral
Descrição
Mixtral 8x7B, um modelo de mistura esparsa de especialistas (SMoE) de alta qualidade com pesos abertos. Mixtral supera o Llama 2 70B na maioria dos benchmarks com inferência 6 vezes mais rápida. Ele corresponde ou supera o GPT3.5 na maioria dos benchmarks padrão.<br>Papel: https://arxiv.org/pdf/2401.04088.pdf<br>Notícias: https://mistral.ai/news/mixtral-of-experts/
Ferramentas relacionadas
DeepSeek-R1
Os modelos de raciocínio de primeira geração da DeepSeek, DeepSeek-R1-Zero e DeepSeek-R1. DeepSeek-R1-Zero, um modelo treinado por meio de aprendizado por reforço (RL) em larga escala sem ajuste fino supervisionado (SFT) como etapa preliminar, demonstrou desempenho notável em raciocínio.
DeepSeek-V3
Um poderoso modelo de linguagem Mixture-of-Experts (MoE) com 671B parâmetros no total, com 37B ativados para cada token.
Llama 3
Llama3 é um grande modelo de linguagem desenvolvido pela Meta AI. É o sucessor do modelo de linguagem Llama2 da Meta.<br>Endereço de teste online:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Um grande modelo de linguagem de código aberto criado pela xAI
Phi-3
Phi-3 é uma família de modelos de IA abertos desenvolvida pela Microsoft. Os modelos Phi-3 são os pequenos modelos de linguagem (SLM) mais capazes e econômicos disponíveis, superando modelos do mesmo tamanho e do próximo tamanho em vários benchmarks de linguagem, raciocínio, codificação e matemática.
Gemma 4
Gemma 4 é a mais recente série de modelos de linguagem de código aberto do Google, construída sobre a arquitetura Gemini, oferecendo desempenho aprimorado, janelas de contexto mais longas e melhor suporte multilíngue.