Mixtral
คำอธิบาย
Mixtral 8x7B โมเดลผู้เชี่ยวชาญแบบผสมกระจาย (SMoE) คุณภาพสูงที่มีน้ำหนักเปิด Mixtral ทำงานได้ดีกว่า Llama 2 70B ในเกณฑ์มาตรฐานส่วนใหญ่ด้วยการอนุมานที่เร็ว 6 เท่า มันเทียบเท่าหรือดีกว่า GPT3.5 ในเกณฑ์มาตรฐานมาตรฐานส่วนใหญ่<br>กระดาษ: https://arxiv.org/pdf/2401.04088.pdf<br>ข่าว: https://mistral.ai/news/mixtral-of-experts/
เครื่องมือที่เกี่ยวข้อง
DeepSeek-R1
โมเดลการให้เหตุผลรุ่นแรกของ DeepSeek ได้แก่ DeepSeek-R1-Zero และ DeepSeek-R1 DeepSeek-R1-Zero ซึ่งเป็นโมเดลที่ฝึกผ่านการเรียนรู้แบบเสริมกำลัง (RL) ขนาดใหญ่โดยไม่ต้องปรับแต่งแบบมีผู้ดูแล (SFT) เป็นขั้นตอนเบื้องต้น แสดงให้เห็นถึงประสิทธิภาพที่โดดเด่นในการให้เหตุผล
DeepSeek-V3
โมเดลภาษา Mixture-of-Experts (MoE) ที่แข็งแกร่ง มีพารามิเตอร์ทั้งหมด 671B โดยเปิดใช้งาน 37B สำหรับแต่ละโทเคน
Llama 3
Llama3 เป็นโมเดลภาษาขนาดใหญ่ที่พัฒนาโดย Meta AI เป็นผู้สืบทอดของโมเดลภาษา Llama2 ของ Meta<br>ที่อยู่ทดสอบออนไลน์:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
โมเดลภาษาขนาดใหญ่แบบโอเพนซอร์สโดย xAI
Phi-3
Phi-3 คือกลุ่มโมเดล AI แบบเปิดที่พัฒนาโดย Microsoft โมเดล Phi-3 เป็นโมเดลภาษาขนาดเล็ก (SLM) ที่มีความสามารถและคุ้มค่าที่สุดที่มีอยู่ โดยเหนือกว่าโมเดลที่มีขนาดเท่ากันและขนาดถัดไปในเกณฑ์มาตรฐานด้านภาษา การให้เหตุผล การเขียนโค้ด และคณิตศาสตร์ที่หลากหลาย
Gemma 4
Gemma 4 เป็นชุดโมเดลภาษาขนาดใหญ่แบบโอเพนซอร์สล่าสุดของ Google สร้างขึ้นบนสถาปัตยกรรม Gemini มอบประสิทธิภาพที่ดีขึ้น หน้าต่างบริบทที่ยาวขึ้น และการรองรับหลายภาษาที่ดีขึ้น