Mixtral
विवरण
Mixtral 8x7B, उच्च गुणवत्ता वाला स्पार्स मिक्सचर ऑफ एक्सपर्ट्स मॉडल (SMoE) जिसमें खुले वज़न हैं। Mixtral अधिकांश बेंचमार्क में Llama 2 70B से बेहतर प्रदर्शन करता है, जिसमें 6 गुना तेज़ इन्फ़रेंस है। यह अधिकांश मानक बेंचमार्क में GPT3.5 के बराबर या उससे बेहतर है।<br>पेपर: https://arxiv.org/pdf/2401.04088.pdf<br>समाचार: https://mistral.ai/news/mixtral-of-experts/
संबंधित उपकरण
DeepSeek-R1
DeepSeek की पहली पीढ़ी के तर्क मॉडल, DeepSeek-R1-Zero और DeepSeek-R1। DeepSeek-R1-Zero, एक मॉडल जो पर्यवेक्षित फाइन-ट्यूनिंग (SFT) के बिना प्रारंभिक चरण के रूप में बड़े पैमाने पर सुदृढीकरण सीखने (RL) के माध्यम से प्रशिक्षित है, ने तर्क में उल्लेखनीय प्रदर्शन दिखाया।
DeepSeek-V3
एक शक्तिशाली Mixture-of-Experts (MoE) भाषा मॉडल जिसमें कुल 671B पैरामीटर हैं, प्रत्येक टोकन के लिए 37B सक्रिय होते हैं।
Llama 3
Llama3 Meta AI द्वारा विकसित एक बड़ा भाषा मॉडल है। यह Meta के Llama2 भाषा मॉडल का उत्तराधिकारी है।<br>ऑनलाइन परीक्षण पता:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
xAI द्वारा ओपन सोर्स किया गया एक बड़ा भाषा मॉडल
Phi-3
Phi-3, Microsoft द्वारा विकसित खुले AI मॉडलों का एक परिवार है। Phi-3 मॉडल उपलब्ध सबसे सक्षम और लागत प्रभावी छोटे भाषा मॉडल (SLM) हैं, जो विभिन्न भाषा, तर्क, कोडिंग और गणित बेंचमार्क में समान आकार और अगले आकार के मॉडल से बेहतर प्रदर्शन करते हैं।
Gemma 4
Gemma 4 Google का नवीनतम ओपन सोर्स बड़ा भाषा मॉडल श्रृंखला है, जो Gemini आर्किटेक्चर पर निर्मित है, जो बेहतर प्रदर्शन, लंबे संदर्भ विंडो और बेहतर बहुभाषी समर्थन प्रदान करता है।