Mixtral
Deskripsi
Mixtral 8x7B, model pakar campuran jarang (SMoE) berkualitas tinggi dengan bobot terbuka. Mixtral mengungguli Llama 2 70B di sebagian besar benchmark dengan inferensi 6 kali lebih cepat. Ini menyamai atau mengungguli GPT3.5 di sebagian besar benchmark standar.<br>Kertas: https://arxiv.org/pdf/2401.04088.pdf<br>Berita: https://mistral.ai/news/mixtral-of-experts/
Alat Terkait
DeepSeek-R1
Model penalaran generasi pertama DeepSeek, DeepSeek-R1-Zero dan DeepSeek-R1. DeepSeek-R1-Zero, model yang dilatih melalui pembelajaran penguatan (RL) skala besar tanpa fine-tuning terawasi (SFT) sebagai langkah awal, menunjukkan kinerja luar biasa dalam penalaran.
DeepSeek-V3
Model bahasa Mixture-of-Experts (MoE) yang kuat dengan total 671B parameter, dengan 37B diaktifkan untuk setiap token.
Llama 3
Llama3 adalah model bahasa besar yang dikembangkan oleh Meta AI. Ini adalah penerus model bahasa Llama2 milik Meta.<br>Alamat uji online:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Model bahasa besar sumber terbuka yang dibuat oleh xAI
Phi-3
Phi-3 adalah keluarga model AI terbuka yang dikembangkan oleh Microsoft. Model Phi-3 adalah model bahasa kecil (SLM) yang paling cakap dan hemat biaya yang tersedia, mengungguli model dengan ukuran yang sama dan ukuran berikutnya dalam berbagai tolok ukur bahasa, penalaran, pengodean, dan matematika.
Gemma 4
Gemma 4 adalah rangkaian model bahasa besar open source terbaru dari Google, dibangun di atas arsitektur Gemini, menawarkan kinerja yang lebih baik, jendela konteks yang lebih panjang, dan dukungan multibahasa yang lebih baik.