ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

MT-Bench (bàn đánh giá đối thoại)

MT-Bench là điểm chuẩn tiêu chuẩn trong đó GPT-4 tự động chấm điểm khả năng đối thoại nhiều giai đoạn của LLM. Lý luận, viết mã, viết, v.v. sẽ được đánh giá theo thang điểm từ 1 đến 10 thông qua phần hỏi đáp 2 lượt với 80 câu hỏi thuộc 8 hạng mục.

MT-Bench là một tiêu chuẩn đối thoại nhiều giai đoạn do LMSYS Org phát hành vào năm 2023. Nó bao gồm tổng cộng 80 cuộc hội thoại thuộc 8 hạng mục: viết, nhập vai, trích rút, lý luận, toán học, mã hóa, STEM và nhân văn, 10 câu hỏi x 2 lượt mỗi lượt và được tính điểm từ 1 đến 10 bằng phương pháp LLM-as-a-Judge sử dụng GPT-4 làm giám khảo.

Có ba cạm bẫy cần tránh trong hoạt động thực tế vào năm 2026. ① Chi phí chấm điểm: Đánh giá 80 câu hỏi bằng GPT-4o tốn khoảng 2 đến 5 USD mỗi lần và chi phí hàng năm có xu hướng tăng do cần phải thực hiện lại mỗi lần cập nhật mô hình. ② Xu hướng tính điểm: Nghiên cứu đã chỉ ra rằng khi hệ thống GPT-4 chấm điểm, có xu hướng thiên về mô hình tự hệ thống (xu hướng tự nâng cao), do đó, việc xác thực chéo với hệ thống Claude là tiêu chuẩn trong lĩnh vực này. ③Bão hòa điểm: Các vấn đề được tạo ra vào năm 2023 được trộn lẫn vào dữ liệu học tập và số lượng danh mục bị kẹt ở giới hạn trên ngày càng tăng. Trong các trường hợp triển khai do ReviewAI điều tra, đã có nhiều báo cáo về ``Điểm MT-Bench cao nhưng thua trong nhiệm vụ thực tế'' và đánh giá hai trục với Chatbot Arena là giá thị trường vào năm 2026.

Thuật ngữ liên quan