ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

RULER (băng đánh giá bối cảnh dài)

RULER là điểm chuẩn đo lường mức độ chính xác của mô hình ngôn ngữ quy mô lớn (LLM) thực sự có thể xử lý thông tin với độ dài ngữ cảnh được yêu cầu bởi nhiều tác vụ như tìm kiếm, theo dõi và tổng hợp.

RULER là điểm chuẩn đánh giá LLM theo ngữ cảnh dài được NVIDIA công bố vào năm 2024 và có đặc điểm không chỉ là tìm kiếm đối sánh đơn giản (Needle-in-a-Haystack) mà còn có nhiều tác vụ khác nhau như theo dõi nhiều bước tìm kiếm trên nhiều đầu mối, tổng hợp đếm thông tin và học tập trong ngữ cảnh. Nó được sử dụng rộng rãi như một chỉ báo để chọn các mô hình tuyên bố hỗ trợ ngữ cảnh dài vì nó cho phép xác minh từng bước xem liệu một mô hình có thực sự sử dụng độ dài ngữ cảnh danh nghĩa là 128K hay 1M mã thông báo hay không. Trong hoạt động thực tế kể từ năm 2026, không có gì lạ khi các mô hình có sự khác biệt lớn giữa điểm độ dài ngữ cảnh danh nghĩa và điểm RULER. Người ta cho rằng có nhiều trang web bỏ qua "đường cong suy giảm" trong đó độ chính xác giảm khi ngữ cảnh dài hơn và phải đối mặt với sự suy giảm độ chính xác của phản hồi sau khi triển khai. Khi chọn mô hình ngữ cảnh dài cho các ứng dụng RAG hoặc agent, mẹo để tránh những cạm bẫy thực tế là không chỉ xem xét chi phí trung bình và đơn giá mã thông báo mà còn kiểm tra điểm RULER xung quanh độ dài ngữ cảnh sẽ thực sự được sử dụng trước khi đưa ra quyết định.

Thuật ngữ liên quan