Mixtral
Descrizione
Mixtral 8x7B, un modello misto di esperti sparso (SMoE) di alta qualità con pesi aperti. Mixtral supera Llama 2 70B nella maggior parte dei benchmark con inferenza 6 volte più veloce. Eguaglia o supera GPT3.5 nella maggior parte dei benchmark standard.<br>Carta: https://arxiv.org/pdf/2401.04088.pdf<br>Notizie: https://mistral.ai/news/mixtral-of-experts/
Strumenti correlati
DeepSeek-R1
I modelli di ragionamento di prima generazione di DeepSeek, DeepSeek-R1-Zero e DeepSeek-R1. DeepSeek-R1-Zero, un modello addestrato tramite apprendimento per rinforzo (RL) su larga scala senza fine-tuning supervisionato (SFT) come passaggio preliminare, ha dimostrato prestazioni notevoli nel ragionamento.
DeepSeek-V3
Un potente modello linguistico Mixture-of-Experts (MoE) con 671B parametri totali, con 37B attivati per ogni token.
Llama 3
Llama3 è un grande modello linguistico sviluppato da Meta AI. È il successore del modello linguistico Llama2 di Meta.<br>Indirizzo di test online:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Un grande modello linguistico open source creato da xAI
Phi-3
Phi-3 è una famiglia di modelli di IA aperti sviluppati da Microsoft. I modelli Phi-3 sono i piccoli modelli linguistici (SLM) più capaci ed economici disponibili, superando i modelli della stessa dimensione e della dimensione successiva in vari benchmark di linguaggio, ragionamento, codifica e matematica.
Gemma 4
Gemma 4 è l'ultima serie di modelli linguistici open source di Google, basata sull'architettura Gemini, che offre prestazioni migliorate, finestre di contesto più lunghe e un migliore supporto multilingue.