MRR (Xếp hạng đối ứng trung bình) là chỉ số đánh giá để truy xuất thông tin là đối ứng của thứ hạng trong đó câu trả lời đúng xuất hiện đầu tiên trong kết quả tìm kiếm, tính trung bình trên nhiều truy vấn.
MRR (Xếp hạng đối ứng trung bình) được sử dụng rộng rãi như một chỉ số đánh giá để đo lường độ chính xác tìm kiếm của các công cụ tìm kiếm, RAG và hệ thống đề xuất. Đối với mỗi truy vấn, hãy tính nghịch đảo của thứ hạng của câu trả lời đúng đầu tiên (1 cho vị trí thứ nhất, 0,5 cho vị trí thứ 2, 0,333 cho vị trí thứ 3, v.v.) và lấy điểm trung bình của tất cả các truy vấn. Vì đây là chỉ mục nhấn mạnh liệu có thể tìm thấy một câu trả lời đúng nhanh chóng hay không nên nó tương thích với các nhiệm vụ trong đó "một câu trả lời đúng là đủ", chẳng hạn như câu trả lời chính của chatbot hoặc tìm kiếm Câu hỏi thường gặp, nhưng nó có nhược điểm là không phù hợp với các ứng dụng mà bạn muốn đánh giá toàn diện nhiều câu trả lời đúng. Trong các hoạt động thực tế kể từ năm 2026, người ta nói rằng khi RAG được giới thiệu, nó sẽ được sử dụng kết hợp với NDCG và Recall@k để đánh giá hàng loạt và các hoạt động liên tục theo dõi sự suy giảm độ chính xác sẽ được áp dụng rộng rãi tại hiện trường. Chi phí xây dựng một nền tảng đánh giá được cho là sẽ mất vài ngày đến vài tuần nếu sử dụng thư viện eval nguồn mở và phương pháp lựa chọn cơ bản trong trường này là sử dụng MRR và NDCG khác nhau tùy thuộc vào việc có một câu trả lời đúng hay nhiều câu trả lời đúng.