LLM-as-a-Judge là một phương pháp đánh giá trong đó chất lượng đầu ra của một LLM được một LLM khác tự động chấm điểm. Được sử dụng rộng rãi như một giải pháp thay thế cho việc đánh giá thủ công.
LLM-as-a-Judge là một khung đánh giá tự động trong đó các câu trả lời do một LLM tạo ra sẽ được một LLM khác (người xếp hạng) chấm điểm. Đây là phương pháp sử dụng các mô hình hiệu suất cao như Claude Opus và GPT-4o để thực hiện đánh giá về "độ chính xác, tính hữu ích và an toàn" vốn được thực hiện theo truyền thống bởi con người chú thích và được biết đến rộng rãi trong bài báo MT-Bench năm 2023.
Trong hoạt động thực tế vào năm 2026, chi phí đánh giá sẽ giảm xuống khoảng 0,01 USD đến 0,05 USD cho mỗi mặt hàng, nhưng những thành kiến trong việc đánh giá bản thân LLM (ưu tiên các mô hình nội bộ, nhấn mạnh quá mức vào các câu trả lời dài, thiên về các gạch đầu dòng) sẽ trở thành vấn đề cố hữu. Có ba điểm cần lưu ý khi chọn mô hình đánh giá trong hiện trường: (1) sử dụng mô hình mạnh hơn một bước so với mô hình tổng quát (tạo bằng GPT-4o → đánh giá bằng Claude Opus, v.v.), (2) sử dụng lời nhắc đánh giá với Chuỗi suy nghĩ để cải thiện tính nhất quán của điểm số và (3) tương quan với đánh giá thủ công mỗi tháng một lần để tránh trôi dạt.
Theo triển vọng thị trường của ReviewAI, đây là cách hiệu quả nhất về mặt chi phí để kiểm tra chất lượng sau quy trình RAG và xác nhận những cải tiến trong việc tinh chỉnh và ngay cả khi bạn đánh giá 100.000 mặt hàng mỗi tháng, bạn sẽ chỉ tốn hàng chục nghìn yên Nhật. Nó cũng có hiệu quả trong việc phát hiện ảo giác và đánh giá hàng loạt chất lượng đa ngôn ngữ và đang được các nhóm phát triển AI vừa và nhỏ không có cơ sở hạ tầng đánh giá giới thiệu trên thực địa.