DeepSeek-V3
वर्णन
एक मजबूत Mixture-of-Experts (MoE) भाषा मॉडल ज्यामध्ये एकूण 671B पॅरामीटर्स आहेत, प्रत्येक टोकनसाठी 37B सक्रिय होतात.
संबंधित साधने
DeepSeek-R1
DeepSeek च्या पहिल्या पिढीतील तर्कशास्त्र मॉडेल, DeepSeek-R1-Zero आणि DeepSeek-R1. DeepSeek-R1-Zero, एक मॉडेल जे पर्यवेक्षित फाइन-ट्यूनिंग (SFT) शिवाय प्राथमिक पायरी म्हणून मोठ्या प्रमाणावर प्रबलन शिक्षण (RL) द्वारे प्रशिक्षित केले गेले, तर्कशास्त्रात उल्लेखनीय कामगिरी दाखवली.
Llama 3
Llama3 हा Meta AI द्वारे विकसित केलेला एक मोठा भाषा मॉडेल आहे. हा Meta च्या Llama2 भाषा मॉडेलचा उत्तराधिकारी आहे.<br>ऑनलाइन चाचणी पत्ता:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
xAI द्वारा ओपन सोर्स केलेले एक मोठे भाषा मॉडेल
Phi-3
Phi-3 म्हणजे Microsoft द्वारे विकसित केलेल्या खुल्या AI मॉडेल्सचा एक कुटुंब आहे. Phi-3 मॉडेल्स उपलब्ध सर्वात सक्षम आणि किफायतशीर लहान भाषा मॉडेल (SLM) आहेत, जे विविध भाषा, तर्क, कोडिंग आणि गणित बेंचमार्कमध्ये समान आकार आणि पुढील आकाराच्या मॉडेल्सपेक्षा चांगले कार्य करतात.
Gemma 4
Gemma 4 ही Google ची सर्वात अद्ययावत ओपन सोर्स मोठी भाषा मॉडेल मालिका आहे, जी Gemini आर्किटेक्चरवर बांधलेली आहे, जी सुधारित कार्यप्रदर्शन, दीर्घ संदर्भ विंडो आणि चांगले बहुभाषिक समर्थन देते.
Qwen3
Qwen3 ही Alibaba Cloud च्या Qwen टीमने विकसित केलेली मोठी भाषा मॉडेल मालिका आहे. Qwen3-2507 मध्ये Instruct आणि Thinking प्रकारांचा समावेश आहे, ज्यात 235B-A22B, 30B-A3B आणि 4B आकार, 256K दीर्घ संदर्भ आणि काही परिस्थितींमध्ये 1M-टोकन इनपुट समर्थन आहे.