LiveCodeBench
Mô tả
LiveCodeBench là một chuẩn đánh giá toàn diện và không bị nhiễm bẩn cho LLM về mã, liên tục thu thập các vấn đề mới theo thời gian. Đặc biệt, LiveCodeBench cũng tập trung vào các khả năng rộng hơn liên quan đến mã, như tự sửa chữa, thực thi mã và dự đoán đầu ra kiểm thử, ngoài việc chỉ tạo mã.
Công cụ liên quan
LLM Stats
LLM Stats là bảng xếp hạng LLM toàn diện nhất, đo điểm chuẩn và so sánh các mô hình API bằng cách sử dụng dữ liệu cộng đồng mã nguồn mở được cập nhật hàng ngày về khả năng, giá cả, tốc độ và độ dài ngữ cảnh.
Giá mỗi Token
So sánh giá API LLM của hơn 200 mô hình từ OpenAI, Anthropic, Google, v.v. Bao gồm bộ đếm token, máy tính chi phí và so sánh điểm chuẩn.
LMSYS Chatbot Arena Leaderboard
LMSYS Chatbot Arena là nền tảng mở crowdsourced để đánh giá LLM. Đã thu thập hơn 1.000.000 so sánh cặp từ con người để xếp hạng các LLM bằng mô hình Bradley-Terry và hiển thị xếp hạng mô hình theo thang Elo.
Artificial Analysis
Artificial Analysis là nền tảng cung cấp các so sánh và điểm chuẩn về mô hình AI và nhà cung cấp dịch vụ để giúp người dùng đưa ra quyết định sáng suốt khi lựa chọn mô hình AI và nhà cung cấp dịch vụ. Nền tảng này cung cấp dữ liệu so sánh về nhiều loại mô hình AI phổ biến, bao gồm GPT-4 của OpenAI, Llama 3 của Meta và dòng Claude của Anthropic, bao gồm các chỉ số hiệu suất như thời gian phản hồi, độ trễ và chi phí.
BenchGecko
Lớp dữ liệu của nền kinh tế AI. Bảng xếp hạng điểm chuẩn mô hình AI với so sánh giá giữa hàng trăm nhà cung cấp. Theo dõi hàng nghìn mô hình trên 128 điểm chuẩn, chỉ số kinh tế AI, bảng xếp hạng tác nhân và thư mục máy chủ MCP. API miễn phí.