ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

ARC-AGI-2 (Bàn suy luận mục đích chung Phiên bản thứ 2)

ARC-AGI-2 là phiên bản cải tiến của tiêu chuẩn ARC-AGI, đo lường khả năng suy luận trừu tượng của AI bằng cách sử dụng các câu đố hình học lần đầu tiên được thấy và là chỉ số đánh giá thiên về trí thông minh tổng quát không thể giải bằng trí nhớ hoặc số lượng.

ARC-AGI-2 là phiên bản thứ hai của ARC-AGI được Quỹ Giải thưởng ARC phát hành vào năm 2025 và được coi là chuẩn mực để đo lường khả năng suy luận các quy tắc từ một số lượng nhỏ các mẫu hình học và áp dụng chúng vào các bài toán mới. Trong khi con người có thể trả lời chính xác hầu hết tất cả các câu hỏi, các mô hình ngôn ngữ quy mô lớn được thiết kế để khó giải quyết bằng cách ghi nhớ dữ liệu học tập hoặc thử sức mạnh và được coi trong ngành như một chỉ báo về khả năng tương tự như suy luận mục đích chung (AGI). Trong hoạt động thực tế kể từ năm 2026, điều đáng tiếc là điểm cao không nhất thiết phải tương quan trực tiếp với hiệu suất của agent và người ta nói rằng trong lĩnh vực này, người ta thường đánh giá ARC-AGI-2 kết hợp với mã hóa và điểm chuẩn nhiệm vụ dài hạn, thay vì đánh giá một mình. Ngoài ra, mô hình càng cao thì tiêu thụ càng nhiều token suy luận và không thể bỏ qua giá thị trường nên cần cân nhắc sự cân bằng giữa độ chính xác và chi phí khi lựa chọn mô hình.

Thuật ngữ liên quan