FrontierMath là chuẩn mực khó nhất đo lường khả năng suy luận của các mô hình AI sử dụng các bài toán có độ khó cao mà ngay cả các chuyên gia cũng phải mất hàng giờ đến hàng ngày để giải quyết.
FrontierMath là một chuẩn mực toán học do Epoch AI phát hành vào năm 2024. Nó bao gồm khoảng 300 bài toán cấp độ nghiên cứu trong các lĩnh vực như hình học đại số, lý thuyết số và động lực học, đồng thời được cho là đủ khó để ngay cả các chuyên gia cũng phải mất vài giờ đến vài ngày mới giải được. Vì nhiều mô hình tiên tiến nhất có tỷ lệ trả lời đúng chỉ vài phần trăm nên nó được coi là một tiêu chuẩn ngành như một chỉ báo sau khi các tiêu chuẩn hiện có đã bão hòa. Tuy nhiên, có một số cạm bẫy trong hoạt động thực tế kể từ năm 2026. Người ta đã chỉ ra rằng do một số câu hỏi không được công khai nên rất khó để xác minh từ bên ngoài xem việc tăng điểm là do khả năng suy luận được cải thiện thực tế hay do dữ liệu đào tạo bị ô nhiễm. Hơn nữa, khi sử dụng nó để lựa chọn mô hình tại hiện trường, cần lưu ý rằng mặc dù điểm FrontierMath có mối tương quan chặt chẽ với nghiên cứu toán học nâng cao và lý luận nhiều bước phức tạp, nhưng chúng là một chỉ báo riêng biệt với chất lượng hỗ trợ mã hóa hàng ngày và tạo văn bản. Các mô hình có điểm cao hơn có xu hướng có mã thông báo suy luận cao hơn và số tiền thanh toán cao hơn, do đó, trong lĩnh vực này, điều cần thiết là chọn các mô hình không chỉ dựa trên điểm cao mà còn dựa trên giá trị thị trường và hiệu quả chi phí trong các nhiệm vụ thực tế.