Mixtral
Açıklama
Mixtral 8x7B, açık ağırlıklı, yüksek kaliteli seyrek uzman karışımı modelidir (SMoE). Mixtral, çoğu kıyaslamada Llama 2 70B'yi geride bırakır ve 6 kat daha hızlı çıkarım yapar. Çoğu standart kıyaslamada GPT3.5'e eşit veya ondan daha iyidir.<br>Makale: https://arxiv.org/pdf/2401.04088.pdf<br>Haberler: https://mistral.ai/news/mixtral-of-experts/
İlgili araçlar
DeepSeek-R1
DeepSeek'in ilk nesil akıl yürütme modelleri, DeepSeek-R1-Zero ve DeepSeek-R1. DeepSeek-R1-Zero, ön adım olarak denetimli ince ayar (SFT) yapılmadan büyük ölçekli pekiştirmeli öğrenme (RL) ile eğitilmiş bir model, akıl yürütmede dikkat çekici bir performans sergiledi.
DeepSeek-V3
Her token için 37B'si etkinleştirilen, toplam 671B parametreye sahip güçlü bir Mixture-of-Experts (MoE) dil modeli.
Llama 3
Llama3, Meta AI tarafından geliştirilen büyük bir dil modelidir. Meta'nın Llama2 dil modelinin halefidir.<br>Çevrimiçi test adresi:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
xAI tarafından açık kaynak olarak sunulan büyük bir dil modeli
Phi-3
Phi-3, Microsoft tarafından geliştirilen açık yapay zeka modelleri ailesidir. Phi-3 modelleri, dil, akıl yürütme, kodlama ve matematik kriterlerinin çeşitliliğinde aynı boyuttaki ve bir sonraki boyuttaki modelleri geride bırakarak mevcut en yetenekli ve uygun maliyetli küçük dil modelleridir (SLM).
Gemma 4
Gemma 4, Google'ın Gemini mimarisi üzerine inşa edilmiş en son açık kaynaklı büyük dil modeli serisidir; geliştirilmiş performans, daha uzun bağlam pencereleri ve daha iyi çok dilli destek sunar.