ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

LongBench (băng ghế ngữ cảnh dài)

LongBench là một chuẩn mực đa tác vụ, đa ngôn ngữ nhằm đo lường mức độ chính xác mà các mô hình ngôn ngữ quy mô lớn có thể hiểu và xử lý các ngữ cảnh dài.

LongBench là tiêu chuẩn tiêu biểu để đo lường khả năng hiểu ngữ cảnh dài hạn của các mô hình ngôn ngữ quy mô lớn, do nhóm nghiên cứu từ Đại học Thanh Hoa (THU) phát hành. Nó được đặc trưng bởi một cấu hình đánh giá nhiều nhiệm vụ như tóm tắt, QA, hoàn thành mã và học ngắn gọn bằng tiếng Anh và tiếng Trung để xác minh xem mô hình có thể trích xuất chính xác thông tin cần thiết từ đầu vào của hàng chục nghìn mã thông báo hay không. Trong hoạt động thực tế kể từ năm 2026, ngay cả những mô hình có điểm chuẩn cao cũng đã được chỉ ra là có những vấn đề như bỏ sót thông tin giữa chừng khi tìm kiếm tài liệu thực tế hoặc tóm tắt những phút dài, và nhiều người cho rằng việc đưa ra quyết định thực hiện chỉ dựa trên điểm công khai là rất nguy hiểm. Khi chọn một mô hình tại hiện trường, thông lệ tiêu chuẩn là sử dụng các kết quả điểm chuẩn như LongBench làm điểm bắt đầu và tiến hành xác minh bổ sung bằng mô hình gần với dữ liệu thực tế và nhiệm vụ thực tế của chính công ty. Ngoài ra, cửa sổ ngữ cảnh càng rộng thì chi phí suy luận càng cao, do đó việc lựa chọn phương pháp dựa trên sự cân bằng giữa độ dài ngữ cảnh yêu cầu và chi phí ngày càng trở nên phổ biến hơn.

Thuật ngữ liên quan