DeepSeek-V3
Descrizione
Un potente modello linguistico Mixture-of-Experts (MoE) con 671B parametri totali, con 37B attivati per ogni token.
Strumenti correlati
DeepSeek-R1
I modelli di ragionamento di prima generazione di DeepSeek, DeepSeek-R1-Zero e DeepSeek-R1. DeepSeek-R1-Zero, un modello addestrato tramite apprendimento per rinforzo (RL) su larga scala senza fine-tuning supervisionato (SFT) come passaggio preliminare, ha dimostrato prestazioni notevoli nel ragionamento.
Llama 3
Llama3 è un grande modello linguistico sviluppato da Meta AI. È il successore del modello linguistico Llama2 di Meta.<br>Indirizzo di test online:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Un grande modello linguistico open source creato da xAI
Phi-3
Phi-3 è una famiglia di modelli di IA aperti sviluppati da Microsoft. I modelli Phi-3 sono i piccoli modelli linguistici (SLM) più capaci ed economici disponibili, superando i modelli della stessa dimensione e della dimensione successiva in vari benchmark di linguaggio, ragionamento, codifica e matematica.
Gemma 4
Gemma 4 è l'ultima serie di modelli linguistici open source di Google, basata sull'architettura Gemini, che offre prestazioni migliorate, finestre di contesto più lunghe e un migliore supporto multilingue.
Qwen3
Qwen3 è la serie di modelli linguistici di grandi dimensioni sviluppata dal team Qwen di Alibaba Cloud. Qwen3-2507 include varianti Instruct e Thinking con dimensioni 235B-A22B, 30B-A3B e 4B, contesto lungo 256K e supporto per input da 1 milione di token in alcuni scenari.