DeepSeek-R1
विवरण
DeepSeek की पहली पीढ़ी के तर्क मॉडल, DeepSeek-R1-Zero और DeepSeek-R1। DeepSeek-R1-Zero, एक मॉडल जो पर्यवेक्षित फाइन-ट्यूनिंग (SFT) के बिना प्रारंभिक चरण के रूप में बड़े पैमाने पर सुदृढीकरण सीखने (RL) के माध्यम से प्रशिक्षित है, ने तर्क में उल्लेखनीय प्रदर्शन दिखाया।
संबंधित उपकरण
DeepSeek-V3
एक शक्तिशाली Mixture-of-Experts (MoE) भाषा मॉडल जिसमें कुल 671B पैरामीटर हैं, प्रत्येक टोकन के लिए 37B सक्रिय होते हैं।
Llama 3
Llama3 Meta AI द्वारा विकसित एक बड़ा भाषा मॉडल है। यह Meta के Llama2 भाषा मॉडल का उत्तराधिकारी है।<br>ऑनलाइन परीक्षण पता:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
xAI द्वारा ओपन सोर्स किया गया एक बड़ा भाषा मॉडल
Phi-3
Phi-3, Microsoft द्वारा विकसित खुले AI मॉडलों का एक परिवार है। Phi-3 मॉडल उपलब्ध सबसे सक्षम और लागत प्रभावी छोटे भाषा मॉडल (SLM) हैं, जो विभिन्न भाषा, तर्क, कोडिंग और गणित बेंचमार्क में समान आकार और अगले आकार के मॉडल से बेहतर प्रदर्शन करते हैं।
Gemma 4
Gemma 4 Google का नवीनतम ओपन सोर्स बड़ा भाषा मॉडल श्रृंखला है, जो Gemini आर्किटेक्चर पर निर्मित है, जो बेहतर प्रदर्शन, लंबे संदर्भ विंडो और बेहतर बहुभाषी समर्थन प्रदान करता है।
Qwen3
Qwen3, Alibaba Cloud के Qwen टीम द्वारा विकसित बड़े भाषा मॉडल श्रृंखला है। Qwen3-2507 में Instruct और Thinking वेरिएंट शामिल हैं, जिनमें 235B-A22B, 30B-A3B और 4B आकार, 256K लंबा संदर्भ, और कुछ परिदृश्यों में 1M-टोकन इनपुट समर्थन शामिल है।