ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

IFEval (hướng dẫn theo băng ghế dự bị)

IFEval là một tiêu chuẩn tuân theo hướng dẫn để chấm điểm một cách máy móc mức độ chính xác mà một mô hình ngôn ngữ quy mô lớn có thể thực hiện theo các hướng dẫn cụ thể, chẳng hạn như ``viết trong 300 ký tự trở xuống.''

IFEval là một tiêu chuẩn tuân theo hướng dẫn do Google đề xuất vào năm 2023. Nó nhúng một số lượng lớn lời nhắc với các hướng dẫn có thể được đánh giá một cách máy móc là đúng hoặc sai, chẳng hạn như ``Viết trong 300 từ trở xuống'' và ``Sử dụng 3 tiêu đề trở lên'', sau đó chấm điểm mô hình dựa trên hai tiêu chí: nghiêm ngặt và lỏng lẻo. Cùng với MMLU và GSM8K, đây là một trong những chỉ số tiêu chuẩn ngành thường xuyên xuất hiện trong các bảng so sánh hiệu năng khi các model mới được công bố. Tuy nhiên, trong hoạt động thực tế vào năm 2026, điều đáng tiếc là ngay cả khi điểm IFEval cao, nó sẽ không đảm bảo cách diễn đạt kính ngữ duy nhất đối với tiếng Nhật hoặc các quy định định dạng nội bộ và điểm chuẩn sẽ có một hạn chế ở chỗ nó sẽ chủ yếu tập trung vào hướng dẫn tiếng Anh tiêu chuẩn. Khi chọn một mô hình tại chỗ, thông lệ tiêu chuẩn là sử dụng IFEval làm giá trị tham chiếu và thiết lập riêng một thử nghiệm theo hướng dẫn duy nhất mô phỏng trường hợp sử dụng của công ty bạn. Bản thân việc đánh giá là một tập lệnh công khai miễn phí, nhưng bạn cũng nên ước tính rằng chi phí của lệnh gọi API sẽ tích lũy nếu bạn chạy nó trên nhiều mô hình.

Thuật ngữ liên quan