LiveCodeBench
Açıklama
LiveCodeBench, zaman içinde sürekli olarak yeni problemler toplayan, kod için LLM'lerin bütüncül ve kontaminasyondan arındırılmış bir değerlendirme kıyaslamasıdır. Özellikle LiveCodeBench, yalnızca kod üretiminin ötesinde, kendi kendini onarma, kod yürütme ve test çıktısı tahmini gibi daha geniş kodla ilgili yeteneklere de odaklanır.
İlgili araçlar
LLM Stats
LLM Stats, yetenek, fiyat, hız ve bağlam uzunluğu hakkında günlük güncellenen açık kaynak topluluk verilerini kullanarak API modellerini karşılaştıran ve kıyaslayan en kapsamlı LLM lider tablosudur.
Token Başına Fiyat
OpenAI, Anthropic, Google ve daha fazlasından 200'den fazla modelin LLM API fiyatlarını karşılaştırın. Token sayaçları, maliyet hesaplayıcıları ve kıyaslama karşılaştırmaları içerir.
LMSYS Chatbot Arena Leaderboard
LMSYS Chatbot Arena, LLM değerlendirmeleri için kitle kaynaklı açık bir platformdur. LLM'leri Bradley-Terry modeliyle sıralamak ve model puanlarını Elo ölçeğinde göstermek için 1.000.000'den fazla insan ikili karşılaştırması topladı.
Artificial Analysis
Artificial Analysis, yapay zeka modelleri ve hizmet sağlayıcıları karşılaştırmaları ve kıyaslamaları sunan bir platformdur; kullanıcıların yapay zeka modelleri ve hizmet sağlayıcıları seçerken bilinçli kararlar almasına yardımcı olur. Platform, OpenAI'ın GPT-4'ü, Meta'nın Llama 3'ü ve Anthropic'in Claude serisi dahil olmak üzere çok çeşitli popüler yapay zeka modelleri hakkında karşılaştırmalı veriler sunar ve yanıt süresi, gecikme süresi ve maliyet gibi performans metriklerini kapsar.
BenchGecko
AI ekonomisinin veri katmanı. Yüzlerce sağlayıcı arasında çapraz sağlayıcı fiyat karşılaştırması sunan AI model kıyaslama lider tablosu. 128 kıyaslamada binlerce modeli, AI ekonomi göstergelerini, ajan lider tablosunu ve MCP sunucu dizinini izler. Ücretsiz API.