Qwen3
Mô tả
Qwen3 là dòng mô hình ngôn ngữ lớn do nhóm Qwen tại Alibaba Cloud phát triển. Qwen3-2507 bao gồm các biến thể Instruct và Thinking với kích thước 235B-A22B, 30B-A3B và 4B, ngữ cảnh dài 256K và hỗ trợ đầu vào 1 triệu token trong một số tình huống.
Công cụ liên quan
DeepSeek-R1
Các mô hình suy luận thế hệ đầu tiên của DeepSeek, DeepSeek-R1-Zero và DeepSeek-R1. DeepSeek-R1-Zero, một mô hình được huấn luyện thông qua học tăng cường (RL) quy mô lớn mà không cần tinh chỉnh có giám sát (SFT) như bước sơ bộ, đã thể hiện hiệu suất vượt trội trong suy luận.
DeepSeek-V3
Mô hình ngôn ngữ Mixture-of-Experts (MoE) mạnh mẽ với tổng 671B tham số, trong đó 37B được kích hoạt cho mỗi token.
Llama 3
Llama3 là mô hình ngôn ngữ lớn do Meta AI phát triển. Đây là phiên bản kế nhiệm của mô hình ngôn ngữ Llama2 của Meta.<br>Địa chỉ kiểm tra trực tuyến:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Mô hình ngôn ngữ lớn mã nguồn mở do xAI phát hành
Phi-3
Phi-3 là một gia đình các mô hình AI mở do Microsoft phát triển. Các mô hình Phi-3 là các mô hình ngôn ngữ nhỏ (SLM) có khả năng và tiết kiệm chi phí nhất hiện có, vượt trội so với các mô hình cùng kích thước và kích thước tiếp theo trong nhiều chuẩn đánh giá về ngôn ngữ, lập luận, mã hóa và toán học.
Gemma 4
Gemma 4 là dòng mô hình ngôn ngữ lớn mã nguồn mở mới nhất của Google, được xây dựng trên kiến trúc Gemini, mang lại hiệu suất được cải thiện, cửa sổ ngữ cảnh dài hơn và hỗ trợ đa ngôn ngữ tốt hơn.