SimpleQA là một tiêu chuẩn được OpenAI công bố vào năm 2024 nhằm đo lường tỷ lệ câu trả lời đúng và xu hướng ảo giác (câu trả lời sai) trong các câu hỏi kiểm tra tính xác thực bằng câu trả lời ngắn.
SimpleQA là một tiêu chuẩn thực tế do OpenAI phát hành vào năm 2024 nhằm đo lường mức độ chính xác của LLM có thể trả lời các câu hỏi có câu trả lời ngắn được thu thập từ nhiều lĩnh vực như địa lý, lịch sử và khoa học, đồng thời nhận ra sai lầm là sai lầm. Nó được áp dụng rộng rãi như một phương pháp đánh giá tiêu chuẩn ngành vì nó không chỉ bao gồm tỷ lệ câu trả lời đúng đơn giản mà còn bao gồm mức độ tin cậy và mức độ thống nhất giữa độ chính xác thực tế (hiệu chuẩn), do đó có thể hình dung liệu mô hình có thể trả lời trung thực "Tôi không biết" hay không. Trong hoạt động thực tế kể từ năm 2026, ngay cả các mô hình có điểm SimpleQA cao cũng sẽ có một cạm bẫy là độ chính xác sẽ giảm đáng kể khi được hỏi về thông tin không có trong dữ liệu đào tạo, chẳng hạn như tài liệu nội bộ hoặc các lĩnh vực chuyên môn và người ta cho rằng cần phải sử dụng cấu hình RAG tại hiện trường. Mặc dù bản thân điểm chuẩn được cung cấp miễn phí, nhưng việc tái tạo nó bằng dữ liệu nội bộ đòi hỏi kỹ sư phải mất nhiều giờ để tạo câu hỏi và chuẩn bị dữ liệu câu trả lời chính xác và người ta nói rằng ngay cả việc xác minh quy mô nhỏ cũng có thể mất hàng giờ làm việc. Khi chọn một mô hình, thông lệ tiêu chuẩn trong hiện trường là không lấy điểm của SimpleQA theo mệnh giá mà phải kiểm tra giá trị thị trường bằng bộ kiểm tra gần với trường hợp sử dụng của riêng bạn trước khi áp dụng nó.