LiveCodeBench
विवरण
LiveCodeBench कोड के लिए LLM का एक समग्र और संदूषण-मुक्त मूल्यांकन बेंचमार्क है जो समय के साथ लगातार नई समस्याएं एकत्र करता है। विशेष रूप से, LiveCodeBench केवल कोड निर्माण से परे, स्व-मरम्मत, कोड निष्पादन और परीक्षण आउटपुट भविष्यवाणी जैसी व्यापक कोड-संबंधी क्षमताओं पर भी ध्यान केंद्रित करता है।
संबंधित उपकरण
LLM Stats
LLM Stats सबसे व्यापक LLM लीडरबोर्ड है, जो क्षमता, मूल्य, गति और संदर्भ लंबाई पर प्रतिदिन अपडेट होने वाले ओपन-सोर्स समुदाय डेटा का उपयोग करके API मॉडलों का बेंचमार्क और तुलना करता है।
प्रति टोकन मूल्य
OpenAI, Anthropic, Google और अन्य के 200+ मॉडलों के LLM API मूल्यों की तुलना करें। इसमें टोकन काउंटर, लागत कैलकुलेटर और बेंचमार्क तुलनाएँ शामिल हैं।
LMSYS Chatbot Arena Leaderboard
LMSYS Chatbot Arena LLM मूल्यांकन के लिए एक क्राउडसोर्स्ड खुला मंच है। इसने 1,000,000 से अधिक मानव युग्मित तुलनाओं को एकत्र किया है ताकि Bradley-Terry मॉडल के साथ LLM को रैंक किया जा सके और Elo-पैमाने पर मॉडल रेटिंग प्रदर्शित की जा सके।
Artificial Analysis
Artificial Analysis एक ऐसा प्लेटफ़ॉर्म है जो AI मॉडल और सेवा प्रदाताओं की तुलना और बेंचमार्क प्रदान करता है, ताकि उपयोगकर्ता AI मॉडल और सेवा प्रदाताओं को चुनते समय सूचित निर्णय ले सकें। यह प्लेटफ़ॉर्म OpenAI के GPT-4, Meta के Llama 3 और Anthropic के Claude श्रृंखला सहित लोकप्रिय AI मॉडलों की एक विस्तृत श्रृंखला पर तुलनात्मक डेटा प्रदान करता है, जिसमें प्रतिक्रिया समय, विलंबता और लागत जैसे प्रदर्शन मेट्रिक्स शामिल हैं।
BenchGecko
AI अर्थव्यवस्था की डेटा परत। AI मॉडल बेंचमार्क लीडरबोर्ड जिसमें सैकड़ों प्रदाताओं के बीच क्रॉस-प्रोवाइडर मूल्य तुलना शामिल है। 128 बेंचमार्क में हजारों मॉडलों को ट्रैक करता है, AI अर्थव्यवस्था संकेतक, एजेंट लीडरबोर्ड और MCP सर्वर निर्देशिका। मुफ्त API।