GRPO là viết tắt của Tối ưu hóa chính sách tương đối nhóm và là một phương pháp tinh chỉnh LLM bằng cách sử dụng học tăng cường. Bởi vì nó nhóm nhiều đầu ra và học với phần thưởng tương đối nên nó có chi phí tính toán thấp hơn PPO truyền thống.
GRPO là phương pháp tinh chỉnh LLM dựa trên học tập tăng cường do DeepSeek đề xuất vào năm 2024. PPO truyền thống yêu cầu mạng giá trị (mạng quan trọng), nhưng GRPO loại bỏ nhu cầu về mạng giá trị bằng cách tạo ra nhiều đầu ra dưới dạng một nhóm từ cùng một lời nhắc và sử dụng phần thưởng tương đối trong nhóm làm đường cơ sở. Ưu điểm lớn nhất là mức tiêu thụ bộ nhớ GPU có thể giảm khoảng 40% so với PPO.
Sau thành công của DeepSeek-R1, kể từ năm 2026, nó đang trở thành một phương pháp tiêu chuẩn trên thực tế để tinh chỉnh các hệ thống Qwen/Llama theo suy luận cụ thể. Theo khảo sát của ReviewAI, mức giá trung bình cho việc học GRPO mô hình 7B với cấu hình A100 x 8 là 300.000 đến 600.000 yên Nhật mỗi tháng (GPU đám mây), khiến các nhóm vừa và nhỏ có thể triển khai nó.
Có hai cạm bẫy chính trong hoạt động thực tế. ① Nếu quy mô nhóm nhỏ, chênh lệch phần thưởng sẽ tăng lên và việc học tập sẽ trở nên không ổn định (khuyến nghị 8 đến 16 mẫu). ② Thiết kế của chức năng khen thưởng là chìa khóa và đã có báo cáo về các trường hợp trong đó nếu sự cân bằng đa mục tiêu giữa tính chính xác, hình thức và an toàn không chính xác, thì ``câu trả lời mỏng chỉ mang tính hình thức'' sẽ được sản xuất hàng loạt. Kể từ năm 2026, GRPOTrainer được triển khai trong thư viện TRL của HuggingFace đang trở thành một công cụ tiêu chuẩn trong lĩnh vực này.