HealthBench là một tiêu chuẩn đánh giá được thiết kế để đo lường mức độ chính xác và an toàn của các mô hình ngôn ngữ quy mô lớn có thể trả lời các câu hỏi liên quan đến y tế.
HealthBench (Medical Response Bench) là một tiêu chuẩn do OpenAI và các tổ chức khác công bố để đo lường chất lượng phản hồi của các mô hình ngôn ngữ quy mô lớn trong lĩnh vực y tế. Đây là một khuôn khổ để chấm điểm các câu trả lời cho một số lượng lớn lời nhắc liên quan đến y tế được tạo ra dưới sự giám sát của bác sĩ từ các khía cạnh như độ chính xác, an toàn và sự đồng cảm. Hệ thống này được đặc trưng bởi thiết kế nhấn mạnh liệu thông tin phù hợp có thể được cung cấp tùy theo tình hình và mức độ khẩn cấp của bệnh nhân hay không, thay vì chỉ đơn giản là xác định xem thông tin đó đúng hay sai. Trong hoạt động thực tế kể từ năm 2026, ngay cả khi một mô hình có điểm cao, nó không đảm bảo rằng nó có thể được sử dụng như trong bối cảnh lâm sàng thực tế và phương pháp điều trị tiêu chuẩn trong lĩnh vực này sẽ là giữ nó ở vị trí bổ sung tuân theo các quy định pháp lý và xác nhận cuối cùng của các chuyên gia y tế. Một điều đáng tiếc là khi theo đuổi việc cải thiện điểm chuẩn, việc điều chỉnh được tối ưu hóa cho các cụm từ cụ thể và có những trường hợp không đi kèm hiệu suất khái quát hóa đối với các mẫu câu hỏi không xác định. Khi chọn một công cụ, điều quan trọng là phải so sánh và xem xét không chỉ điểm HealthBench mà còn cả tính minh bạch của các nguồn do RAG cung cấp, tuyên bố từ chối trách nhiệm trong trường hợp thông tin sai lệch và sự cân bằng với chi phí hoạt động.