ARC-AGI là điểm chuẩn công khai do François Chollet thiết kế để đo lường khả năng suy luận có mục đích chung của AI. Nó bao gồm các nhiệm vụ suy luận mô hình hình học rõ ràng đối với con người và được tham chiếu rộng rãi trong ngành như một chỉ số đại diện cho thành tích AGI.
ARC-AGI (Abstraction and Reasoning Corpus for Artificial General Intelligence) là một tiêu chuẩn đánh giá AI được xuất bản bởi François Chollet, người tạo ra Keras, vào năm 2019. Nhiệm vụ này bao gồm suy ra các quy tắc bằng cách xem xét các mẫu trừu tượng như màu sắc, hình dạng và tính đối xứng. Con người trả lời đúng trung bình khoảng 85% thời gian, nhưng LLM thế hệ GPT-4 và Claude 3 vẫn duy trì ở mức 20-40% trong nhiều năm.
Vào cuối năm 2024, o3 của OpenAI đạt hơn 87% trong điều kiện tính toán cao, gây sốc cho ngành và đến năm 2026, ARC-AGI-2 đã được phát hành và mức độ khó càng được nâng lên. Có những cạm bẫy quan trọng từ góc độ hoạt động thực tế của ReviewAI. Có thông tin cho rằng chi phí suy luận khi o3 ghi điểm cao là vài trăm đến vài nghìn đô la cho mỗi câu hỏi, hoàn toàn khác với chi phí sử dụng API trung bình trong lĩnh vực này. Ngay cả những mô hình có điểm cao cũng thường không đạt được kỳ vọng trong các trường hợp sử dụng nội bộ (tạo mã, tóm tắt tài liệu, trích xuất dữ liệu) và rất rủi ro khi quyết định áp dụng mô hình nào chỉ dựa trên số ARC-AGI. Kể từ năm 2026, phương pháp lựa chọn tiêu chuẩn trong lĩnh vực này là sử dụng ARC-AGI làm ''giá trị tham chiếu cho giới hạn trên của khả năng suy luận trừu tượng'' và để đánh giá độc lập các phán đoán thực tế bằng cách sử dụng các nhiệm vụ nội bộ.