Mixtral
Beschrijving
Mixtral 8x7B, een hoogwaardig spaarzaam mengsel van experts-model (SMoE) met open gewichten. Mixtral presteert beter dan Llama 2 70B in de meeste benchmarks met 6x snellere inferentie. Het evenaart of overtreft GPT3.5 in de meeste standaard benchmarks.<br>Papier: https://arxiv.org/pdf/2401.04088.pdf<br>Nieuws: https://mistral.ai/news/mixtral-of-experts/
Gerelateerde tools
DeepSeek-R1
De eerste generatie redeneermodellen van DeepSeek, DeepSeek-R1-Zero en DeepSeek-R1. DeepSeek-R1-Zero, een model dat is getraind via grootschalig reinforcement learning (RL) zonder supervised fine-tuning (SFT) als voorbereidende stap, toonde opmerkelijke prestaties op het gebied van redeneren.
DeepSeek-V3
Een krachtig Mixture-of-Experts (MoE)-taalmodel met in totaal 671B parameters, waarvan er 37B worden geactiveerd voor elk token.
Llama 3
Llama3 is een groot taalmodel ontwikkeld door Meta AI. Het is de opvolger van Meta's Llama2-taalmodel.<br>Online testadres:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Een groot taalmodel met open source, uitgebracht door xAI
Phi-3
Phi-3 is een familie van open AI-modellen ontwikkeld door Microsoft. Phi-3-modellen zijn de meest capabele en kosteneffectieve kleine taalmodellen (SLM's) die beschikbaar zijn, en overtreffen modellen van dezelfde grootte en de volgende grootte in een verscheidenheid aan benchmarks voor taal, redeneren, coderen en wiskunde.
Gemma 4
Gemma 4 is de nieuwste open source-serie grote taalmodellen van Google, gebouwd op de Gemini-architectuur, met verbeterde prestaties, langere contextvensters en betere meertalige ondersteuning.