ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

WildBench (bảng đánh giá thực tế)

WildBench là điểm chuẩn đánh giá chấm điểm chất lượng phản hồi LLM bằng cách sử dụng danh sách kiểm tra cho từng tác vụ, dựa trên nhật ký trò chuyện đa dạng và khó do người dùng thực tế đăng.

WildBench là một điểm chuẩn đánh giá trích xuất các nhiệm vụ có độ khó cao như tóm tắt, mã hóa và suy luận từ các nhật ký hội thoại khác nhau của người dùng thực được gửi tới Chatbot Arena, v.v. và chấm điểm các phản hồi LLM theo danh sách kiểm tra được chuẩn bị cho từng nhiệm vụ. Nó được cho là sử dụng các chỉ số như WB-Score và WB-Reward. Không giống như điểm chuẩn với một câu trả lời đúng duy nhất như MMLU, nó được đặc trưng bởi khả năng đánh giá các câu trả lời bằng văn bản tự do gần với hoạt động thực tế. Kể từ năm 2026, trong lĩnh vực này, các hoạt động kết hợp đang trở nên phổ biến, trong đó các công ty không chỉ dựa vào thứ hạng công khai trên bảng xếp hạng mà còn thử lại bằng cách sử dụng lời nhắc từ miền riêng của họ và một lựa chọn thực tế là tiến hành quan sát điểm cố định hàng tháng hoặc hàng quý, có tính đến chi phí gọi LLM để đánh giá nhiều lần và tâm lý thị trường. Người ta cũng chia sẻ rộng rãi rằng việc lựa chọn một mô hình chỉ dựa trên xếp hạng của một điểm chuẩn duy nhất là rất rủi ro.

Thuật ngữ liên quan