Mixtral
توضیحات
Mixtral 8x7B، یک مدل ترکیبی متخصص اسپارس (SMoE) با کیفیت بالا با وزنهای باز. Mixtral در اکثر معیارها از Llama 2 70B بهتر عمل میکند و استنتاج آن ۶ برابر سریعتر است. در اکثر معیارهای استاندارد با GPT3.5 برابری یا برتری دارد.<br>مقاله: https://arxiv.org/pdf/2401.04088.pdf<br>اخبار: https://mistral.ai/news/mixtral-of-experts/
ابزارهای مرتبط
DeepSeek-R1
مدلهای استدلال نسل اول DeepSeek، DeepSeek-R1-Zero و DeepSeek-R1. DeepSeek-R1-Zero، مدلی که از طریق یادگیری تقویتی (RL) در مقیاس بزرگ بدون تنظیم دقیق نظارتشده (SFT) به عنوان مرحله مقدماتی آموزش دیده است، عملکرد قابل توجهی در استدلال نشان داد.
DeepSeek-V3
یک مدل زبانی قوی Mixture-of-Experts (MoE) با مجموع 671B پارامتر که برای هر توکن 37B فعال میشود.
Llama 3
Llama3 یک مدل زبانی بزرگ است که توسط Meta AI توسعه یافته است. این جانشین مدل زبانی Llama2 متا است.<br>آدرس تست آنلاین:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
مدل زبانی بزرگ متنباز ساختهشده توسط xAI
Phi-3
Phi-3 خانوادهای از مدلهای هوش مصنوعی باز است که توسط مایکروسافت توسعه یافته است. مدلهای Phi-3 توانمندترین و مقرونبهصرفهترین مدلهای زبانی کوچک (SLM) موجود هستند و در معیارهای مختلف زبان، استدلال، کدنویسی و ریاضیات از مدلهای هماندازه و اندازه بعدی بهتر عمل میکنند.
Gemma 4
Gemma 4 جدیدترین سری مدلهای زبانی بزرگ متنباز گوگل است که بر روی معماری Gemini ساخته شده و عملکرد بهبود یافته، پنجرههای زمینه طولانیتر و پشتیبانی چندزبانه بهتری را ارائه میدهد.