MRCR (Băng truy xuất nhiều tham chiếu) là chỉ số đánh giá ngữ cảnh dài nhằm đo lường xem liệu LLM có thể phân biệt và trích xuất các tham chiếu chính xác hay không bằng cách nhúng nhiều tham chiếu tương tự trong một ngữ cảnh dài.
MRCR là một điểm chuẩn do Google DeepMind nghĩ ra để đánh giá hiệu suất của các mô hình nhận biết ngữ cảnh dài như Gemini và là phương pháp cho phép các hướng dẫn hoặc câu có cùng định dạng xuất hiện nhiều lần trong một ngữ cảnh, đồng thời đo lường xem mô hình có thể xác định chính xác tham chiếu nào mà nó đang đề cập đến hay không. Nó được đặc trưng không chỉ bởi độ chính xác tìm kiếm kiểu kim tiêm đơn giản mà còn bởi khả năng phát hiện sự nhầm lẫn giữa các thông tin tương tự (nhầm lẫn về tài liệu tham khảo) và được sử dụng rộng rãi để so sánh hiệu suất của các mô hình tuyên bố hỗ trợ bối cảnh dài. Tuy nhiên, người ta đã chỉ ra rằng trong vận hành thực tế kể từ năm 2026, ngay cả khi điểm công bố cao thì độ chính xác có thể thấp hơn mong đợi khi xét đến số liệu thực tế có nhiều cụm từ mơ hồ như tài liệu nội bộ, lịch sử đàm phán kinh doanh. Khi sử dụng nó để lựa chọn mô hình tại hiện trường, bạn không cần chỉ dựa vào điểm MRCR mà còn phải tính đến chi phí kiểm tra lại với dữ liệu gần với trường hợp sử dụng của công ty bạn hơn. Nói chung, mô hình càng lớn thì chi phí suy luận bổ sung để đánh giá bối cảnh dài càng cao, do đó, việc ưu tiên xác minh đơn giản bằng cách sử dụng dữ liệu nội bộ và coi MRCR như một chỉ báo bổ sung là thực tế.