Arena-Hard là một chuẩn mực so sánh và đánh giá chất lượng phản hồi của LLM bằng cách sử dụng tập hợp các lời nhắc có độ khó cao được LMSYS trích xuất từ các bài đăng của người dùng thực.
Arena-Hard được cho là một điểm chuẩn sử dụng khoảng 500 lời nhắc có độ khó cao được trích xuất từ các tương tác thực tế của người dùng trên Chatbot Arena và so sánh chất lượng phản hồi theo cặp với mô hình lớp GPT-4 với tư cách là giám khảo. Nó được cho là khác với các dạng câu hỏi trắc nghiệm như MMLU ở chỗ nó tập trung vào những câu hỏi khó mà ngay cả con người cũng gặp khó khăn khi quyết định, chẳng hạn như mã hóa, lý luận toán học và làm theo các hướng dẫn phức tạp. Trong hoạt động thực tế kể từ năm 2026, người ta đã chỉ ra rằng mô hình trọng tài có xu hướng đưa ra các câu trả lời dư thừa và cho điểm cao ở các định dạng cụ thể và việc chọn mô hình chỉ dựa trên một chỉ báo duy nhất được coi là nguy hiểm. Vì việc tính điểm liên quan đến việc gọi API trọng tài nên cần ước tính chi phí từ hàng trăm đến hàng nghìn lệnh gọi API để đánh giá lại thường xuyên. Trong thực tế, thông lệ tiêu chuẩn là sử dụng nó kết hợp với các điểm chuẩn khác và đánh giá theo từng lĩnh vực cụ thể để đưa ra đánh giá toàn diện.