ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

RLHF (Học tăng cường với phản hồi của con người)

RLHF là một phương pháp học tăng cường sử dụng đánh giá và phản hồi của con người làm tín hiệu khen thưởng để điều chỉnh đầu ra LLM phù hợp với ý định của con người.

RLHF là viết tắt của "Học tập tăng cường từ phản hồi của con người" và đã được thiết lập như một công nghệ cốt lõi giúp điều chỉnh các LLM chính hiện đại như ChatGPT và Claude trở nên "hữu ích, vô hại và trung thực". Quy trình cơ bản là 1) SFT (tinh chỉnh có giám sát), 2) Tập hợp xếp hạng so sánh đầu ra của người chú thích con người, 3) Học tập mô hình phần thưởng (RM) và 4) Tối ưu hóa chính sách bằng cách sử dụng học tăng cường như PPO.

Là một cạm bẫy trong hoạt động thực tế kể từ năm 2026, nó thường xuyên xảy ra trong lĩnh vực có sự thay đổi về chất lượng của trình chú thích làm ảnh hưởng trực tiếp đến độ chính xác của mô hình phần thưởng. Đặc biệt, trong các công việc tiếng Nhật có nhiều trường hợp tiêu chuẩn kiểm soát chất lượng cho rằng tiếng Anh không đáp ứng được. Ngoài ra, một hiện tượng được gọi là "hack phần thưởng" - một hành vi trong đó mô hình đi chệch khỏi mục đích ban đầu và chỉ tối đa hóa phần thưởng - có nhiều khả năng xảy ra hơn ở các RM quy mô nhỏ.

Về mặt chi phí, việc chạy nội bộ RLHF lớp GPT-4 đầy đủ sẽ cần hàng trăm triệu yên Nhật cho tài nguyên tính toán và chi phí chú thích. Theo triển vọng thị trường đến năm 2026 do ReviewAI khảo sát, các phương pháp thay thế RLHF bằng DPO (Tối ưu hóa ưu tiên trực tiếp) và RLAIF (phản hồi từ AI đến AI) đang trở thành xu hướng chủ đạo trong các doanh nghiệp vừa và nhỏ. Khi chọn phương pháp căn chỉnh để tạo mô hình dành riêng cho miền kết hợp với tinh chỉnh, đây là phương pháp hiệu quả về mặt chi phí để thử DPO trước tiên.

Thuật ngữ liên quan