DeepSeek-V4
వివరణ
DeepSeek యొక్క 4వ తరం ఫ్లాగ్షిప్ మోడల్. V4-Pro (1.6T MoE) మరియు V4-Flash (284B MoE) 1M సందర్భం, స్థానిక మల్టీమోడాలిటీ మరియు తీవ్ర సామర్థ్యం కోసం Hybrid Attention కలిగి ఉన్నాయి.
సంబంధిత సాధనాలు
DeepSeek-R1
DeepSeek మొదటి తరం రీజనింగ్ మోడల్స్, DeepSeek-R1-Zero మరియు DeepSeek-R1. DeepSeek-R1-Zero, సూపర్వైజ్డ్ ఫైన్-ట్యూనింగ్ (SFT) లేకుండా ప్రాథమిక దశగా పెద్ద ఎత్తున రీన్ఫోర్స్మెంట్ లెర్నింగ్ (RL) ద్వారా శిక్షణ పొందిన మోడల్, రీజనింగ్లో విశేషమైన పనితీరును ప్రదర్శించింది.
DeepSeek-V3
బలమైన Mixture-of-Experts (MoE) భాషా మోడల్, మొత్తం 671B పారామితులతో, ప్రతి టోకెన్కు 37B సక్రియం చేయబడుతుంది.
Llama 3
Llama3 అనేది Meta AI అభివృద్ధి చేసిన పెద్ద భాషా మోడల్. ఇది Meta యొక్క Llama2 భాషా మోడల్ యొక్క వారసుడు.<br>ఆన్లైన్ టెస్ట్ చిరునామా:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
xAI ద్వారా ఓపెన్ సోర్స్ చేయబడిన పెద్ద భాషా మోడల్
Phi-3
Phi-3 అనేది Microsoft అభివృద్ధి చేసిన ఓపెన్ AI మోడళ్ల కుటుంబం. Phi-3 మోడల్స్ అందుబాటులో ఉన్న అత్యంత సామర్థ్యం మరియు ఖర్చు-సమర్థవంతమైన చిన్న భాషా మోడల్స్ (SLM), ఇవి వివిధ భాష, తార్కికం, కోడింగ్ మరియు గణిత బెంచ్మార్క్లలో ఒకే పరిమాణం మరియు తదుపరి పరిమాణం మోడళ్లను అధిగమిస్తాయి.
Gemma 4
Gemma 4 అనేది Google యొక్క తాజా ఓపెన్ సోర్స్ పెద్ద భాషా మోడల్ సిరీస్, ఇది Gemini ఆర్కిటెక్చర్ ఆధారంగా నిర్మించబడింది, మెరుగైన పనితీరు, పొడవైన సందర్భ విండోలు మరియు మెరుగైన బహుభాషా మద్దతును అందిస్తుంది.