Mixtral
विवरण
Mixtral 8x7B, उच्च गुणस्तरको स्पार्स मिक्सचर अफ एक्सपर्ट्स मोडेल (SMoE) खुला तौलसहित। Mixtral धेरैजसो बेन्चमार्कहरूमा Llama 2 70B भन्दा राम्रो प्रदर्शन गर्दछ, 6 गुणा छिटो inference सहित। यो धेरैजसो मानक बेन्चमार्कहरूमा GPT3.5 सँग बराबर वा राम्रो छ।<br>पेपर: https://arxiv.org/pdf/2401.04088.pdf<br>समाचार: https://mistral.ai/news/mixtral-of-experts/
सम्बन्धित उपकरणहरू
DeepSeek-R1
DeepSeek को पहिलो पुस्ताका तर्क मोडेलहरू, DeepSeek-R1-Zero र DeepSeek-R1। DeepSeek-R1-Zero, पर्यवेक्षित फाइन-ट्युनिङ (SFT) बिना प्रारम्भिक चरणको रूपमा ठूलो स्तरको सुदृढीकरण सिकाइ (RL) मार्फत तालिम प्राप्त मोडेलले तर्कमा उल्लेखनीय प्रदर्शन देखायो।
DeepSeek-V3
एक शक्तिशाली Mixture-of-Experts (MoE) भाषा मोडेल जसमा कुल 671B प्यारामिटरहरू छन्, प्रत्येक टोकनको लागि 37B सक्रिय हुन्छन्।
Llama 3
Llama3 Meta AI द्वारा विकसित एक ठूलो भाषा मोडेल हो। यो Meta को Llama2 भाषा मोडेलको उत्तराधिकारी हो।<br>अनलाइन परीक्षण ठेगाना:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
xAI द्वारा खुला स्रोत बनाइएको ठूलो भाषा मोडेल
Phi-3
Phi-3 Microsoft द्वारा विकसित खुला AI मोडेलहरूको परिवार हो। Phi-3 मोडेलहरू उपलब्ध सबैभन्दा सक्षम र लागत-प्रभावी साना भाषा मोडेलहरू (SLM) हुन्, जसले विभिन्न भाषा, तर्क, कोडिङ र गणित मापदण्डहरूमा समान आकार र अर्को आकारका मोडेलहरूलाई उछिन्छन्।
Gemma 4
Gemma 4 Google को सबैभन्दा नयाँ खुला स्रोत ठूलो भाषा मोडेल श्रृंखला हो, जुन Gemini आर्किटेक्चरमा निर्मित छ, जसले सुधारिएको प्रदर्शन, लामो सन्दर्भ विन्डोहरू र राम्रो बहुभाषी समर्थन प्रदान गर्दछ।