LiveCodeBench
توضیحات
LiveCodeBench یک معیار ارزیابی جامع و عاری از آلودگی برای LLM برای کد است که به طور مداوم مشکلات جدید را در طول زمان جمعآوری میکند. به طور خاص، LiveCodeBench همچنین بر قابلیتهای گستردهتر مرتبط با کد مانند خودتعمیری، اجرای کد و پیشبینی خروجی تست، فراتر از صرف تولید کد تمرکز میکند.
ابزارهای مرتبط
LLM Stats
LLM Stats جامعترین جدول رتبهبندی LLM است که با استفاده از دادههای جامعه منبعباز که روزانه بهروزرسانی میشوند، مدلهای API را بر اساس توانایی، قیمت، سرعت و طول زمینه معیار و مقایسه میکند.
قیمت هر توکن
قیمت API مدلهای LLM را برای بیش از ۲۰۰ مدل از OpenAI، Anthropic، Google و موارد دیگر مقایسه کنید. شامل شمارنده توکن، ماشین حساب هزینه و مقایسه معیارها است.
LMSYS Chatbot Arena Leaderboard
LMSYS Chatbot Arena یک پلتفرم باز crowdsourced برای ارزیابی LLM است. بیش از ۱٬۰۰۰٬۰۰۰ مقایسه زوجی انسانی جمعآوری کرده است تا LLM ها را با مدل Bradley-Terry رتبهبندی کند و رتبهبندی مدلها را در مقیاس Elo نمایش دهد.
Artificial Analysis
Artificial Analysis پلتفرمی است که مقایسهها و معیارهای مدلهای هوش مصنوعی و ارائهدهندگان خدمات را فراهم میکند تا به کاربران در تصمیمگیری آگاهانه هنگام انتخاب مدلهای هوش مصنوعی و ارائهدهندگان خدمات کمک کند. این پلتفرم دادههای مقایسهای را برای طیف گستردهای از مدلهای محبوب هوش مصنوعی، از جمله GPT-4 از OpenAI، Llama 3 از Meta و سری Claude از Anthropic ارائه میدهد که معیارهای عملکردی مانند زمان پاسخ، تأخیر و هزینه را پوشش میدهد.
BenchGecko
لایه داده اقتصاد هوش مصنوعی. جدول رتبهبندی معیار مدلهای هوش مصنوعی با مقایسه قیمت بین صدها ارائهدهنده. هزاران مدل را در 128 معیار، شاخصهای اقتصاد هوش مصنوعی، جدول رتبهبندی عاملها و فهرست سرورهای MCP ردیابی میکند. API رایگان.