ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

RAGAS (Khung đánh giá RAG)

RAGAS là một khung nguồn mở tự động đánh giá chất lượng phản hồi của hệ thống RAG. Giám khảo LLM sẽ chấm điểm bốn chỉ số về độ trung thực, mức độ phù hợp của phản hồi, độ chính xác của ngữ cảnh và tính toàn diện của ngữ cảnh để định lượng tác động của việc điều chỉnh.

RAGAS là một khuôn khổ được phát triển bởi Exploding Gradents nhằm đánh giá định lượng toàn bộ đường ống RAG. Bốn chỉ số cốt lõi là Độ trung thực (mức độ đúng của câu trả lời với ngữ cảnh), Mức độ liên quan của câu trả lời (mức độ liên quan với câu hỏi), Độ chính xác của ngữ cảnh (độ chính xác của kết quả tìm kiếm) và Thu hồi ngữ cảnh (phạm vi bao gồm thông tin bắt buộc), tất cả đều sử dụng LLM làm mô hình đánh giá.

Có hai cạm bẫy thường bị bỏ qua trong hoạt động thực tế vào năm 2026: "chi phí đánh giá" và "sai lệch của mô hình đánh giá". Nếu bạn đánh giá 100 mặt hàng thuộc loại GPT-4, giá trung bình là từ 2 đến 5 đô la và khi quy mô tăng lên, ước tính sẽ nhanh chóng sai lệch. Nhiều trang web đang chuyển sang Gemini Flash hoặc Claude Haiku để giảm chi phí, nhưng điều này có tác dụng phụ là làm giảm độ chính xác của mô hình đánh giá và giảm độ tin cậy của điểm số.

Phương pháp lựa chọn chủ đạo tại hiện trường là lấy mẫu (10-20%) thay vì đánh giá tất cả các trường hợp. Mẫu tối ưu hóa chi phí thực hiện bộ lọc thô chỉ sử dụng hai chỉ báo Độ trung thực và Mức độ liên quan của câu trả lời và chỉ đánh giá các câu trả lời có điểm thấp một cách chi tiết sẽ có hiệu quả. Chất lượng của bộ vàng (bộ QA để đánh giá) ảnh hưởng đến điểm cuối cùng nên sự chú thích của các chuyên gia miền là rất cần thiết. Mô hình hoạt động được đề xuất của ReviewAI là tích hợp với các công cụ MLOps như Trọng lượng & Xu hướng để theo dõi sự suy giảm điểm số theo thời gian.

Thuật ngữ liên quan