ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

HellaSwag (băng ghế lý luận thông thường)

HellaSwag là một chuẩn mực đo lường khả năng suy luận thông thường của mô hình AI bằng cách yêu cầu người dùng chọn từ bốn câu tự nhiên sau mô tả về một tình huống.

HellaSwag là một tiêu chuẩn lý luận thông thường được đề xuất bởi Zellers et al. vào năm 2019 và bao gồm chú thích video hoặc lời giải thích tình huống được trích từ một bài viết trên WikiHow, sau đó là phần kết cho phép người dùng chọn trong số bốn lựa chọn vốn là tự nhiên đối với con người nhưng lại gây khó hiểu cho máy móc. Các mô hình ngôn ngữ quy mô lớn sau GPT-3 đã đạt được điểm số gần bằng tỷ lệ chính xác của con người (khoảng 95%) và được cho là một chỉ báo bão hòa khiến khó nhận ra sự khác biệt về hiệu suất khi chỉ sử dụng. Trong hoạt động thực tế kể từ năm 2026, sẽ có rất ít trang web chọn mô hình chỉ sử dụng HellaSwag và việc so sánh điểm số kết hợp với các điểm chuẩn khác như MMLU và GSM8K là điều phổ biến. Ngoài ra, bản thân phương pháp tạo mẫu đối nghịch đã lỗi thời và người ta đã chỉ ra rằng có nguy cơ "nhiễm bẩn" khi nội dung điểm chuẩn được trộn lẫn vào dữ liệu huấn luyện của các mô hình tiếp theo. Về mặt chi phí, việc tự mình gọi lại mô hình và tái tạo nó rất tốn kém, vì vậy trong nhiều trường hợp, chỉ cần sử dụng các số liệu trên bảng xếp hạng đã được công bố làm tài liệu tham khảo về xu hướng thị trường là đủ.

Thuật ngữ liên quan