Đánh giá thủ công là phương pháp đánh giá mô hình trong đó con người trực tiếp chấm điểm và đánh giá chất lượng đầu ra của văn bản, hình ảnh, v.v. do AI tạo sinh.
Đánh giá con người là một phương pháp trong đó người chú thích con người trực tiếp đánh giá `` tính tự nhiên '', `` độ chính xác '' và `` mức độ gây hại '' mà không thể đo lường được bằng các chỉ báo đánh giá tự động như BLEU và ROUGE. Nó rất cần thiết cho sự phát triển LLM và đảm bảo chất lượng của các dịch vụ AI được tạo ra.
Trong hoạt động thực tế, điều cần thiết là chuẩn bị các hướng dẫn để ngăn chặn sự khác biệt chủ quan giữa những người chú thích và đo lường sự đồng thuận giữa những người đánh giá (IAA). Tính đến năm 2026, giá thị trường ước tính là từ 5 đến 20 đô la cho mỗi nhiệm vụ đối với các lĩnh vực chuyên môn (y tế/luật pháp) và 1 đến 3 đô la đối với sách giáo khoa phổ thông. Đội ngũ đánh giá nội bộ mang lại chất lượng ổn định hơn so với Crowdsourcing nhưng chi phí cao gấp 3 đến 5 lần.
Một cạm bẫy phổ biến trong lĩnh vực này là “thiết kế sai mức độ chi tiết của thang đánh giá”, có xu hướng dẫn đến xu hướng tập trung hóa, tập trung vào giá trị trung bình trong đánh giá năm cấp độ. Ngoài ra, LLM-as-Judge, công cụ đánh giá các câu trả lời LLM, đang gia tăng nhưng nên kết hợp nó với đánh giá thủ công để đảm bảo độ tin cậy cuối cùng.