ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

MMLU

Hiểu ngôn ngữ đa nhiệm lớn. Điểm chuẩn đánh giá kiến ​​thức LLM của 57 lĩnh vực và 15.000 câu hỏi.

MMLU (Hiểu ngôn ngữ đa nhiệm lớn) là một chuẩn mực điển hình để đo lường lượng kiến ​​thức trong LLM và bao gồm khoảng 15.000 câu hỏi trắc nghiệm trong 57 lĩnh vực (toán học, luật, y học, lịch sử, v.v.). Tính đến năm 2026, GPT-5 / Claude Opus 4.7 / Gemini Ultra đã vượt mức trung bình của chuyên gia con người (89,8%) vào khoảng 89-92%. Tuy nhiên, người ta đã chỉ ra rằng mô hình có thể có vấn đề với MMLU trong dữ liệu huấn luyện (vấn đề rò rỉ), do đó nó bị bão hòa làm chỉ báo so sánh giữa các mô hình hàng đầu. MMLU-Pro/GPQA đã xuất hiện với tư cách là người kế nhiệm. ReviewAI luôn bao gồm các chỉ số kế thừa MMLU + trong các bài viết so sánh LLM.

Thuật ngữ liên quan