GPQA là chuẩn đánh giá nhằm đo lường khả năng suy luận của AI với các câu hỏi khó cấp độ sau đại học về sinh học, vật lý và hóa học. Nó được đặc trưng bởi một thiết kế không thể giải quyết được ngay cả khi tìm kiếm trên Google.
GPQA (Hỏi đáp bằng chứng Google-Proof cấp độ sau đại học) là một điểm chuẩn dành riêng cho độ khó được tham chiếu bởi các tổ chức nghiên cứu AI lớn như Anthropic, Google và OpenAI. Nó khác với các tiêu chuẩn khác ở chỗ nó bao gồm các câu hỏi cấp độ sau đại học về sinh học, vật lý và hóa học, đồng thời đo lường “khả năng suy luận thuần túy” mà các tìm kiếm trên web không thể dựa vào. Ngay cả đối với các chuyên gia về con người, tỷ lệ trả lời đúng chỉ khoảng 65% và tập hợp con khó nhất ``GPQA Diamond'' đã trở thành tiêu chuẩn ngành để so sánh mô hình biên giới. Tính đến năm 2026, điểm Kim cương của các mẫu máy chính được báo cáo là khoảng 50% đối với GPT-4o và khoảng 70% đối với Claude 3.7 Sonnet và ngày càng được coi là giá trị tham khảo trong lĩnh vực này để lựa chọn mẫu máy. Tuy nhiên, một cạm bẫy trong vận hành thực tế là GPQA chỉ là chỉ số đánh giá khả năng suy luận dành cho chuyên môn liên quan đến khoa học và có mối tương quan thấp với việc tạo tài liệu kinh doanh, mã hóa và độ chính xác của tiếng Nhật. Tại ReviewAI, chúng tôi khuyên bạn nên coi điểm GPQA là ``giá trị tham chiếu cho trí thông minh'' và kết hợp chúng với các đánh giá độc lập dựa trên các nhiệm vụ tương tự như trường hợp sử dụng của riêng bạn.