LiveCodeBench
Beskrivning
LiveCodeBench är en holistisk och kontamineringsfri utvärderingsbenchmark för LLM:er för kod som kontinuerligt samlar in nya problem över tid. Särskilt fokuserar LiveCodeBench också på bredare kodrelaterade förmågor, såsom självreparation, kodutförande och förutsägelse av testutdata, utöver enbart kodgenerering.
Relaterade verktyg
LLM Stats
LLM Stats är den mest omfattande LLM-ledartavlan som benchmarkar och jämför API-modeller med hjälp av dagligen uppdaterade open source-communitydata om kapacitet, pris, hastighet och kontextlängd.
Pris per token
Jämför LLM API-priser för 200+ modeller från OpenAI, Anthropic, Google och mer. Inkluderar token-räknare, kostnadskalkylatorer och benchmark-jämförelser.
LMSYS Chatbot Arena Leaderboard
LMSYS Chatbot Arena är en crowdsourcad öppen plattform för LLM-utvärderingar. Samlade över 1 000 000 mänskliga parvisa jämförelser för att ranka LLM:er med Bradley-Terry-modellen och visa modellbetygen på Elo-skalan.
Artificial Analysis
Artificial Analysis är en plattform som tillhandahåller jämförelser och riktmärken av AI-modeller och tjänsteleverantörer för att hjälpa användare att fatta välgrundade beslut när de väljer AI-modeller och tjänsteleverantörer. Plattformen tillhandahåller jämförande data om ett brett utbud av populära AI-modeller, inklusive OpenAIs GPT-4, Metas Llama 3 och Anthropics Claude-serie, som täcker prestandamått som svarstid, latens och kostnad.
BenchGecko
Datalagret för AI-ekonomin. AI-modell benchmark leaderboard med prisjämförelse mellan hundratals leverantörer. Spårar tusentals modeller över 128 benchmarks, indikatorer för AI-ekonomin, agent-ledartavla och MCP-serverkatalog. Gratis API.