LiveCodeBench
Description
LiveCodeBench est une référence d'évaluation holistique et sans contamination des LLM pour le code, qui collecte continuellement de nouveaux problèmes au fil du temps. En particulier, LiveCodeBench se concentre également sur des capacités liées au code plus larges, telles que l'auto-réparation, l'exécution de code et la prédiction de sortie de test, au-delà de la simple génération de code.
Outils similaires
LLM Stats
LLM Stats est le classement LLM le plus complet, qui évalue et compare les modèles API à l'aide de données communautaires open source mises à jour quotidiennement sur les capacités, le prix, la vitesse et la longueur du contexte.
Prix par token
Comparez les prix des API LLM pour plus de 200 modèles d'OpenAI, Anthropic, Google, etc. Comprend des compteurs de tokens, des calculateurs de coûts et des comparaisons de benchmarks.
LMSYS Chatbot Arena Leaderboard
LMSYS Chatbot Arena est une plateforme ouverte issue du crowdsourcing pour les évaluations de LLM. Elle a collecté plus de 1 000 000 de comparaisons humaines par paires pour classer les LLM avec le modèle Bradley-Terry et afficher les notes des modèles à l'échelle Elo.
Artificial Analysis
Artificial Analysis est une plateforme qui fournit des comparaisons et des benchmarks de modèles d'IA et de fournisseurs de services pour aider les utilisateurs à prendre des décisions éclairées lors du choix de modèles d'IA et de fournisseurs de services. La plateforme fournit des données comparatives sur un large éventail de modèles d'IA populaires, notamment GPT-4 d'OpenAI, Llama 3 de Meta et la série Claude d'Anthropic, couvrant des métriques de performance telles que le temps de réponse, la latence et le coût.
BenchGecko
La couche de données de l'économie de l'IA. Classement de référence des modèles d'IA avec comparaison des prix entre des centaines de fournisseurs. Suit des milliers de modèles sur 128 benchmarks, indicateurs de l'économie de l'IA, classement des agents et répertoire de serveurs MCP. API gratuite.