DeepSeek-R1
Beskrivelse
DeepSeeks første generasjons resonneringsmodeller, DeepSeek-R1-Zero og DeepSeek-R1. DeepSeek-R1-Zero, en modell trent gjennom storskala forsterkende læring (RL) uten veiledet finjustering (SFT) som et innledende trinn, viste bemerkelsesverdig ytelse innen resonnering.
Relaterte verktøy
DeepSeek-V3
En sterk Mixture-of-Experts (MoE)-språkmodell med totalt 671B parametere, med 37B aktivert for hvert token.
Llama 3
Llama3 er en stor språkmodell utviklet av Meta AI. Den er etterfølgeren til Metas Llama2-språkmodell.<br>Online testadresse:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
En stor språkmodell med åpen kildekode fra xAI
Phi-3
Phi-3 er en familie av åpne AI-modeller utviklet av Microsoft. Phi-3-modeller er de mest dyktige og kostnadseffektive små språkmodellene (SLM) som finnes, og overgår modeller av samme størrelse og neste størrelse i en rekke benchmarks for språk, resonnering, koding og matematikk.
Gemma 4
Gemma 4 er Googles nyeste serie med åpne store språkmodeller, bygget på Gemini-arkitekturen, som gir forbedret ytelse, lengre kontekstvinduer og bedre flerspråklig støtte.
Qwen3
Qwen3 er serien med store språkmodeller utviklet av Qwen-teamet hos Alibaba Cloud. Qwen3-2507 inkluderer Instruct- og Thinking-varianter med størrelsene 235B-A22B, 30B-A3B og 4B, 256K lang kontekst og støtte for 1 million token-innlegg i noen scenarier.