DeepSeek-R1
Açıklama
DeepSeek'in ilk nesil akıl yürütme modelleri, DeepSeek-R1-Zero ve DeepSeek-R1. DeepSeek-R1-Zero, ön adım olarak denetimli ince ayar (SFT) yapılmadan büyük ölçekli pekiştirmeli öğrenme (RL) ile eğitilmiş bir model, akıl yürütmede dikkat çekici bir performans sergiledi.
İlgili araçlar
DeepSeek-V3
Her token için 37B'si etkinleştirilen, toplam 671B parametreye sahip güçlü bir Mixture-of-Experts (MoE) dil modeli.
Llama 3
Llama3, Meta AI tarafından geliştirilen büyük bir dil modelidir. Meta'nın Llama2 dil modelinin halefidir.<br>Çevrimiçi test adresi:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
xAI tarafından açık kaynak olarak sunulan büyük bir dil modeli
Phi-3
Phi-3, Microsoft tarafından geliştirilen açık yapay zeka modelleri ailesidir. Phi-3 modelleri, dil, akıl yürütme, kodlama ve matematik kriterlerinin çeşitliliğinde aynı boyuttaki ve bir sonraki boyuttaki modelleri geride bırakarak mevcut en yetenekli ve uygun maliyetli küçük dil modelleridir (SLM).
Gemma 4
Gemma 4, Google'ın Gemini mimarisi üzerine inşa edilmiş en son açık kaynaklı büyük dil modeli serisidir; geliştirilmiş performans, daha uzun bağlam pencereleri ve daha iyi çok dilli destek sunar.
Qwen3
Qwen3, Alibaba Cloud'un Qwen ekibi tarafından geliştirilen büyük dil modeli serisidir. Qwen3-2507, 235B-A22B, 30B-A3B ve 4B boyutlarında Instruct ve Thinking varyantlarını, 256K uzun bağlamı ve bazı senaryolarda 1M token girişi desteğini içerir.