HLE là bộ benchmark cực khó được ra mắt vào năm 2025 bởi Scale AI và Trung tâm An toàn AI (CAIS) nhằm đo lường giới hạn suy luận của AI với 2.500 câu hỏi cấp độ tiến sĩ.
Humanity's Last Exam (HLE) là bài kiểm tra AI được công bố bởi Scale AI và Trung tâm An toàn AI (CAIS) vào tháng 1 năm 2025. Chứa 2.500 câu hỏi khó từ hơn 100 lĩnh vực chuyên ngành như toán học, vật lý, hóa học, sinh học, lịch sử và triết học đòi hỏi "kiến thức và lý luận chân chính" không thể giải được bằng cách tìm kiếm một mình. Tất cả các câu hỏi đều có câu trả lời chính xác có thể kiểm chứng và được thiết kế để ngay cả các chuyên gia cũng không thể giải quyết được.
Khi được phát hành lần đầu tiên, tỷ lệ câu trả lời đúng ở mức thấp dưới 10% đối với GPT-4o và Claude 3.5 Sonnet, đồng thời nó đã thu hút sự chú ý như một dấu hiệu cho thấy ``AI vẫn chưa đạt đến giới hạn kiến thức của con người.'' Tính đến năm 2026, ngay cả với mô hình biên giới, tỷ lệ câu trả lời đúng vẫn nằm trong phạm vi 20-30% và nó được tham chiếu rộng rãi trong các hoạt động nghiên cứu và hoạt động thực tế như một thước đo thực tế về thành tích AGI.
Trong các cuộc khảo sát thực địa của ReviewAI, hầu hết các công ty đều coi điểm HLE là một trong nhiều điểm chuẩn chứ không phải chỉ duy nhất. Vào năm 2026, phương pháp lựa chọn tiêu chuẩn sẽ là đánh giá mức độ phù hợp thị trường của nhiệm vụ, độ trễ và chi phí API (gấp 2 đến 5 lần giá tiêu chuẩn cho các mô hình suy luận nâng cao), thay vì nghĩ rằng “HLE cao = tối ưu cho doanh nghiệp”.