Mixtral
Description
Mixtral 8x7B, un modèle de mélange d'experts clairsemé (SMoE) de haute qualité avec des poids ouverts. Mixtral surpasse Llama 2 70B dans la plupart des benchmarks avec une inférence 6 fois plus rapide. Il correspond ou surpasse GPT3.5 dans la plupart des benchmarks standard.<br>Papier : https://arxiv.org/pdf/2401.04088.pdf<br>Nouvelles : https://mistral.ai/news/mixtral-of-experts/
Outils similaires
DeepSeek-R1
Les modèles de raisonnement de première génération de DeepSeek, DeepSeek-R1-Zero et DeepSeek-R1. DeepSeek-R1-Zero, un modèle entraîné par apprentissage par renforcement (RL) à grande échelle sans fine-tuning supervisé (SFT) en étape préliminaire, a démontré des performances remarquables en matière de raisonnement.
DeepSeek-V3
Un puissant modèle de langage Mixture-of-Experts (MoE) avec 671B paramètres au total, dont 37B activés pour chaque jeton.
Llama 3
Llama3 est un grand modèle de langage développé par Meta AI. Il succède au modèle de langage Llama2 de Meta.<br>Adresse de test en ligne :<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Un grand modèle de langage open source réalisé par xAI
Phi-3
Phi-3 est une famille de modèles d'IA ouverts développés par Microsoft. Les modèles Phi-3 sont les petits modèles de langage (SLM) les plus performants et les plus rentables disponibles, surpassant les modèles de même taille et de taille supérieure dans divers benchmarks de langage, de raisonnement, de codage et de mathématiques.
Gemma 4
Gemma 4 est la dernière série de modèles de langage open source de Google, basée sur l'architecture Gemini, offrant des performances améliorées, des fenêtres de contexte plus longues et une meilleure prise en charge multilingue.