Mixtral
वर्णन
Mixtral 8x7B, एक उच्च-गुणवत्तेचे विरळ तज्ज्ञ मिश्रण मॉडेल (SMoE) ज्यामध्ये खुले वजन आहेत. Mixtral बहुतेक बेंचमार्कमध्ये Llama 2 70B ला मागे टाकते, ज्यामध्ये 6 पट वेगवान inference आहे. हे बहुतेक मानक बेंचमार्कमध्ये GPT3.5 सारखे किंवा त्याहून चांगले आहे.<br>पेपर: https://arxiv.org/pdf/2401.04088.pdf<br>बातम्या: https://mistral.ai/news/mixtral-of-experts/
संबंधित साधने
DeepSeek-R1
DeepSeek च्या पहिल्या पिढीतील तर्कशास्त्र मॉडेल, DeepSeek-R1-Zero आणि DeepSeek-R1. DeepSeek-R1-Zero, एक मॉडेल जे पर्यवेक्षित फाइन-ट्यूनिंग (SFT) शिवाय प्राथमिक पायरी म्हणून मोठ्या प्रमाणावर प्रबलन शिक्षण (RL) द्वारे प्रशिक्षित केले गेले, तर्कशास्त्रात उल्लेखनीय कामगिरी दाखवली.
DeepSeek-V3
एक मजबूत Mixture-of-Experts (MoE) भाषा मॉडल ज्यामध्ये एकूण 671B पॅरामीटर्स आहेत, प्रत्येक टोकनसाठी 37B सक्रिय होतात.
Llama 3
Llama3 हा Meta AI द्वारे विकसित केलेला एक मोठा भाषा मॉडेल आहे. हा Meta च्या Llama2 भाषा मॉडेलचा उत्तराधिकारी आहे.<br>ऑनलाइन चाचणी पत्ता:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
xAI द्वारा ओपन सोर्स केलेले एक मोठे भाषा मॉडेल
Phi-3
Phi-3 म्हणजे Microsoft द्वारे विकसित केलेल्या खुल्या AI मॉडेल्सचा एक कुटुंब आहे. Phi-3 मॉडेल्स उपलब्ध सर्वात सक्षम आणि किफायतशीर लहान भाषा मॉडेल (SLM) आहेत, जे विविध भाषा, तर्क, कोडिंग आणि गणित बेंचमार्कमध्ये समान आकार आणि पुढील आकाराच्या मॉडेल्सपेक्षा चांगले कार्य करतात.
Gemma 4
Gemma 4 ही Google ची सर्वात अद्ययावत ओपन सोर्स मोठी भाषा मॉडेल मालिका आहे, जी Gemini आर्किटेक्चरवर बांधलेली आहे, जी सुधारित कार्यप्रदर्शन, दीर्घ संदर्भ विंडो आणि चांगले बहुभाषिक समर्थन देते.