DPO (Tối ưu hóa tùy chọn trực tiếp) là một phương pháp tinh chỉnh nhằm tối ưu hóa trực tiếp LLM từ dữ liệu tùy chọn của con người mà không cần sử dụng mô hình phần thưởng.
DPO (Tối ưu hóa ưu tiên trực tiếp) là một phương pháp được Stanford đề xuất vào năm 2023 nhằm loại bỏ sự phức tạp của RLHF (Học tăng cường phản hồi của con người). RLHF thông thường yêu cầu hai bước: `` học theo mô hình khen thưởng → học tăng cường bằng PPO, '' nhưng DPO tối ưu hóa các chính sách trực tiếp từ các cặp câu trả lời tốt và xấu ưu tiên. Nó nhanh chóng trở nên phổ biến do chi phí tính toán thấp và cách thực hiện đơn giản. Trong các hoạt động thực tế vào năm 2026, tiêu chuẩn sẽ chủ yếu sử dụng nó trong lớp căn chỉnh sau khi điều chỉnh lệnh. Điều đáng tiếc là chất lượng của dữ liệu ưu tiên ảnh hưởng trực tiếp đến độ chính xác, do đó, nếu trộn lẫn chú thích kém vào thì có nguy cơ chất lượng đầu ra sẽ giảm đi đáng kể. Tại hiện trường, nên có ít nhất 1.000 cặp dữ liệu chất lượng cao và chi phí thu thập trung bình thường từ vài trăm đến vài nghìn yên Nhật mỗi cặp. Các phương pháp phái sinh như SimPO, IPO, KTO cũng đã xuất hiện và cần phải so sánh làm cơ sở.