LiveCodeBench
Opis
LiveCodeBench to całościowy i wolny od zanieczyszczeń benchmark oceny LLM dla kodu, który w sposób ciągły gromadzi nowe problemy w czasie. W szczególności LiveCodeBench skupia się również na szerszych możliwościach związanych z kodem, takich jak samonaprawa, wykonywanie kodu i przewidywanie wyników testów, wychodząc poza samo generowanie kodu.
Powiązane narzędzia
LLM Stats
LLM Stats to najbardziej wszechstronny ranking LLM, który porównuje i benchmarkuje modele API, korzystając z codziennie aktualizowanych danych społeczności open source dotyczących wydajności, ceny, szybkości i długości kontekstu.
Cena za token
Porównaj ceny API LLM dla ponad 200 modeli od OpenAI, Anthropic, Google i innych. Zawiera liczniki tokenów, kalkulatory kosztów i porównania benchmarków.
LMSYS Chatbot Arena Leaderboard
LMSYS Chatbot Arena to otwarta platforma crowdsourcingowa do ocen LLM. Zebrano ponad 1 000 000 ludzkich porównań parami, aby uszeregować LLM za pomocą modelu Bradleya-Terry’ego i wyświetlić oceny modeli w skali Elo.
Artificial Analysis
Artificial Analysis to platforma, która zapewnia porównania i benchmarki modeli AI i dostawców usług, aby pomóc użytkownikom w podejmowaniu świadomych decyzji przy wyborze modeli AI i dostawców usług. Platforma udostępnia dane porównawcze dla szerokiej gamy popularnych modeli AI, w tym GPT-4 od OpenAI, Llama 3 od Meta i serię Claude od Anthropic, obejmujące takie wskaźniki wydajności, jak czas odpowiedzi, opóźnienie i koszt.
BenchGecko
Warstwa danych gospodarki AI. Ranking benchmarków modeli AI z porównaniem cen między setkami dostawców. Śledzi tysiące modeli w 128 benchmarkach, wskaźniki gospodarki AI, ranking agentów i katalog serwerów MCP. Darmowe API.