Mixtral
వివరణ
Mixtral 8x7B, అధిక-నాణ్యత గల స్పార్స్ మిక్స్చర్ ఆఫ్ ఎక్స్పర్ట్స్ మోడల్ (SMoE) ఓపెన్ వెయిట్లతో. Mixtral చాలా బెంచ్మార్క్లలో Llama 2 70B కంటే ఉన్నతంగా ఉంది, 6 రెట్లు వేగవంతమైన inference తో. ఇది చాలా ప్రామాణిక బెంచ్మార్క్లలో GPT3.5తో సమానంగా లేదా ఉన్నతంగా ఉంది.<br>పేపర్: https://arxiv.org/pdf/2401.04088.pdf<br>వార్తలు: https://mistral.ai/news/mixtral-of-experts/
సంబంధిత సాధనాలు
DeepSeek-R1
DeepSeek మొదటి తరం రీజనింగ్ మోడల్స్, DeepSeek-R1-Zero మరియు DeepSeek-R1. DeepSeek-R1-Zero, సూపర్వైజ్డ్ ఫైన్-ట్యూనింగ్ (SFT) లేకుండా ప్రాథమిక దశగా పెద్ద ఎత్తున రీన్ఫోర్స్మెంట్ లెర్నింగ్ (RL) ద్వారా శిక్షణ పొందిన మోడల్, రీజనింగ్లో విశేషమైన పనితీరును ప్రదర్శించింది.
DeepSeek-V3
బలమైన Mixture-of-Experts (MoE) భాషా మోడల్, మొత్తం 671B పారామితులతో, ప్రతి టోకెన్కు 37B సక్రియం చేయబడుతుంది.
Llama 3
Llama3 అనేది Meta AI అభివృద్ధి చేసిన పెద్ద భాషా మోడల్. ఇది Meta యొక్క Llama2 భాషా మోడల్ యొక్క వారసుడు.<br>ఆన్లైన్ టెస్ట్ చిరునామా:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
xAI ద్వారా ఓపెన్ సోర్స్ చేయబడిన పెద్ద భాషా మోడల్
Phi-3
Phi-3 అనేది Microsoft అభివృద్ధి చేసిన ఓపెన్ AI మోడళ్ల కుటుంబం. Phi-3 మోడల్స్ అందుబాటులో ఉన్న అత్యంత సామర్థ్యం మరియు ఖర్చు-సమర్థవంతమైన చిన్న భాషా మోడల్స్ (SLM), ఇవి వివిధ భాష, తార్కికం, కోడింగ్ మరియు గణిత బెంచ్మార్క్లలో ఒకే పరిమాణం మరియు తదుపరి పరిమాణం మోడళ్లను అధిగమిస్తాయి.
Gemma 4
Gemma 4 అనేది Google యొక్క తాజా ఓపెన్ సోర్స్ పెద్ద భాషా మోడల్ సిరీస్, ఇది Gemini ఆర్కిటెక్చర్ ఆధారంగా నిర్మించబడింది, మెరుగైన పనితీరు, పొడవైన సందర్భ విండోలు మరియు మెరుగైన బహుభాషా మద్దతును అందిస్తుంది.