MMMU là chuẩn mực đo lường khả năng hiểu biết toàn diện về AI đa phương thức bằng cách sử dụng các câu hỏi chuyên ngành cấp đại học kết hợp văn bản và hình ảnh. Nó bao gồm hơn 11.500 câu hỏi từ hơn 30 lĩnh vực học thuật như y học, luật và kỹ thuật.
MMMU (Hiểu biết đa phương thức đa nhiệm lớn) là một chuẩn mực đánh giá khả năng suy luận phức tạp của các mô hình đa phương thức bằng cách sử dụng AI giải quyết các vấn đề cấp đại học kết hợp hình ảnh, sơ đồ và văn bản. Nó khác với các tiêu chuẩn trực quan thông thường ở chỗ nó yêu cầu lý luận nhiều bước dựa trên kiến thức chuyên môn thay vì nhận dạng đối tượng đơn giản.
Trên bảng xếp hạng công khai, các siêu mẫu hàng đầu đang cạnh tranh với điểm số nằm trong khoảng 60-70%, và người ta cho rằng sự chênh lệch với trình độ chuyên gia con người (86%) vẫn còn rất lớn. Một cạm bẫy phổ biến là sai lầm khi ``so sánh với điểm tổng thể và thế là xong.'' Nếu bạn không kiểm tra điểm danh mục phụ của các lĩnh vực học thuật gần với công việc của bạn, sẽ có nhiều trường hợp độ chính xác lệch khỏi độ chính xác thực tế. Đặc biệt, không hiếm trường hợp hình minh họa có văn bản tiếng Nhật hoặc biểu đồ, bảng biểu chuyên ngành trong lĩnh vực y tế, pháp lý lại bị điểm thấp hơn tổng điểm từ 10 đến 20 điểm. Khi chọn một công cụ, cách tiếp cận đúng đắn trong lĩnh vực này là xem xét điểm phụ của trường tương ứng với trường hợp sử dụng của công ty bạn và chi phí suy luận cần thiết để đánh giá (có thể dao động từ vài trăm đến vài nghìn yên Nhật mỗi đợt).