Đánh giá phiếu tự đánh giá là một phương pháp chấm điểm các kết quả đầu ra và sản phẩm phân phối của AI bằng cách sử dụng nhiều quan điểm đánh giá và các câu tiêu chuẩn được xếp loại để giảm sai lệch giữa những người đánh giá và đưa ra các đánh giá nhất quán.
Đánh giá phiếu tự đánh giá là một thiết kế đánh giá trong đó đầu ra của LLM hoặc sản phẩm của AI agent được chấm điểm bằng cách sử dụng nhiều tiêu chí dựa trên các tiêu chí như `` độ chính xác '', '' tính nhất quán '' và '' an toàn '' để giảm sai lệch giữa người đánh giá và tính điểm LLM (LLM-với tư cách là giám khảo). Thay vì xác định đạt/không dựa trên một điểm duy nhất, khái niệm tiêu chuẩn ngành là có thể theo dõi cơ sở để đánh giá bằng cách diễn đạt các tiêu chí cho từng quan điểm. Trong hoạt động thực tế kể từ năm 2026, nếu tuyên bố tiêu chuẩn không rõ ràng, thì "sự trôi dạt của người đánh giá" trong đó việc chấm điểm LLM trở nên khoan dung hoặc khắc nghiệt có thể sẽ xảy ra và người ta đã chỉ ra rộng rãi rằng đây là một cạm bẫy cần phải xem xét định kỳ tuyên bố tiêu chuẩn và kiểm tra mẫu. Về mặt chi phí, nó rẻ hơn so với đánh giá thủ công, nhưng do các lệnh gọi API tới LLM được sử dụng để tích lũy phán đoán, nên trong lĩnh vực có mục tiêu đánh giá lên tới hàng nghìn, cần phải chọn mô hình phán đoán dựa trên điều kiện thị trường, chẳng hạn như thu hẹp mô hình phán đoán xuống mức nhẹ hơn.