Học tăng cường là một phương pháp học máy trong đó agent tự động học các hành vi nhằm tối đa hóa phần thưởng thông qua việc thử và sai với môi trường. Công nghệ cơ bản được sử dụng để điều chỉnh RLHF của ChatGPT/Claude.
Học tăng cường (RL) là một mô hình trong đó agent học một chiến lược (chính sách) tối ưu bằng cách lặp lại chu trình "trạng thái → hành động → phần thưởng". Đặc điểm lớn nhất của nó là không yêu cầu dữ liệu được giám sát và sau khi thu hút được sự chú ý về AlphaGo và điều khiển robot, nó hiện đang được tích hợp như một công nghệ cốt lõi để cải thiện chất lượng của ChatGPT, Claude và Gemini với tên gọi RLHF (học tập tăng cường với phản hồi của con người).
Có ba điều cần lưu ý trong lĩnh vực này vào năm 2026. ① Sai lầm nghiêm trọng trong thiết kế phần thưởng: Nếu chức năng phần thưởng được thiết kế kém, "hack phần thưởng" sẽ xảy ra, dẫn đến hành vi ngoài ý muốn được tối ưu hóa. ② Chi phí tính toán cao: Nếu bạn xây dựng môi trường RL của riêng mình, chi phí học tập GPU sẽ tăng vọt và giá trung bình cho mỗi lần tinh chỉnh LLM RLHF có thể dao động từ 500 USD đến 50.000 USD. ③ Khó đánh giá: Cần có kiến thức chuyên môn để xác định sự hội tụ và phát hiện sự suy giảm hiệu suất, đồng thời các nhóm không có hệ thống MLOps có khả năng bị quá tải.
Trong hoạt động thực tế, nếu mục đích là điều chỉnh hành vi LLM thì DPO (Tối ưu hóa ưu tiên trực tiếp) thường tiết kiệm chi phí hơn RLHF. Các dịch vụ được quản lý như Amazon Bedrock có thể tiết kiệm nhân công khi triển khai RL và ReviewAI cũng cung cấp sự so sánh các phương pháp theo mục đích làm chỉ báo tham chiếu để lựa chọn công cụ.