Mixtral
Beskrivelse
Mixtral 8x7B, en højkvalitets sparsom blanding af eksperter model (SMoE) med åbne vægte. Mixtral overgår Llama 2 70B i de fleste benchmarks med 6 gange hurtigere inferens. Den matcher eller overgår GPT3.5 i de fleste standard benchmarks.<br>Papir: https://arxiv.org/pdf/2401.04088.pdf<br>Nyheder: https://mistral.ai/news/mixtral-of-experts/
Relaterede værktøjer
DeepSeek-R1
DeepSeeks første generations ræsonneringsmodeller, DeepSeek-R1-Zero og DeepSeek-R1. DeepSeek-R1-Zero, en model trænet via storstilet forstærkningslæring (RL) uden superviseret finjustering (SFT) som et indledende trin, viste bemærkelsesværdig præstation i ræsonnering.
DeepSeek-V3
En stærk Mixture-of-Experts (MoE)-sprogmodel med i alt 671B parametre, hvoraf 37B aktiveres for hvert token.
Llama 3
Llama3 er en stor sprogmodel udviklet af Meta AI. Det er efterfølgeren til Metas Llama2-sprogmodel.<br>Online testadresse:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
En stor sprogmodel med åben kildekode fra xAI
Phi-3
Phi-3 er en familie af åbne AI-modeller udviklet af Microsoft. Phi-3-modeller er de mest dygtige og omkostningseffektive små sprogmodeller (SLM), der er tilgængelige, og overgår modeller af samme størrelse og næste størrelse i en række benchmarks for sprog, ræsonnement, kodning og matematik.
Gemma 4
Gemma 4 er Googles nyeste open source-serie af store sprogmodeller, bygget på Gemini-arkitekturen, og tilbyder forbedret ydeevne, længere kontekstvinduer og bedre flersproget support.