ROUGE là chỉ mục đánh giá tóm tắt tự động chấm điểm các văn bản được tạo bởi LLM hoặc dịch máy dựa trên tỷ lệ khớp n-gram với văn bản tham chiếu.
ROUGE (Nghiên cứu theo định hướng thu hồi để đánh giá Gisting) là một nhóm các số liệu đánh giá NLP định lượng chất lượng bằng cách tính toán mức độ trùng lặp từ/cụm từ giữa văn bản được tạo và văn bản tham chiếu được tạo thủ công. Ba loại thường được sử dụng trong thực tế: ROUGE-1 (đơn vị từ), ROUGE-2 (bigram) và ROUGE-L (dãy chung dài nhất).
Cạm bẫy lớn nhất trong hoạt động thực tế vào năm 2026 là `` ngay cả khi điểm cao, nó sẽ đi chệch khỏi đánh giá của con người.'' Các vấn đề về từ đồng nghĩa vẫn tồn tại, dẫn đến điểm thấp ngay cả khi LLM tóm tắt chính xác bằng cách sử dụng cách diễn đạt khác với câu tham chiếu và việc sử dụng nó kết hợp với BERTScore và LLM-as-Judge đang trở thành tiêu chuẩn trong lĩnh vực này. Trong xác minh của ban biên tập, có trường hợp riêng ROUGE chỉ nắm bắt được khoảng 80% chất lượng thực tế khi đánh giá phản hồi bằng hệ thống RAG.
Theo nguyên tắc chung, việc tính toán có thể được thực hiện bằng thư viện miễn phí (chẳng hạn như rouge-score), nhưng việc tạo một bản tóm tắt tham chiếu đáng tin cậy theo cách thủ công tốn từ 500 đến 2.000 yên Nhật cho mỗi mục và chi phí xây dựng bộ đánh giá là chi phí thực. Kể từ năm 2026, tùy chọn tiết kiệm chi phí là chỉ sử dụng ROUGE-L cho các nhóm nhỏ để có PoC tốc độ cao và để kiểm soát chất lượng sản xuất để kết hợp LLM-as-Judge.