ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Lời nhắc tự phản ánh (Reflexion)

prompt tự phản ánh (Phản xạ) là một kỹ thuật prompt trong đó LLM đánh giá và phê bình kết quả đầu ra của chính họ, đồng thời cải thiện lặp đi lặp lại các câu trả lời của họ dựa trên phản ánh đó.

Phản xạ là một phương pháp được Shinn et al công bố. vào năm 2023, vận hành LLM theo vòng lặp "thực hiện nhiệm vụ → đánh giá → tự phê bình → thử lại." Trong khi Chuỗi tư duy trực quan hóa quá trình suy luận thì cốt lõi của Reflexion là sử dụng việc diễn đạt bằng lời các lỗi thất bại làm phản hồi cho vòng lặp tiếp theo. Nó đã được chứng minh là cải thiện độ chính xác trong việc tạo mã, lý luận toán học và các tác vụ đối thoại, đồng thời được tích hợp rộng rãi vào vòng lặp bên trong của các AI agent.

Vào năm 2026, giá thị trường cho hoạt động thực tế là việc chạy ba vòng Reflexion trong mô hình GPT-4o sẽ phải chịu chi phí mã thông báo gấp 3 đến 5 lần so với một cuộc gọi và sẽ vào khoảng 0,05 USD đến 0,20 USD cho mỗi nhiệm vụ. Cạm bẫy trong lĩnh vực này là “các vòng phản xạ không hạn chế”, và đã có những trường hợp được báo cáo về việc củng cố quá mức theo hướng sai lầm (sự tự tin giống như ảo giác). Khi thử nghiệm ReviewAI, chúng tôi nhận thấy rằng thiết kế tiết kiệm chi phí là giới hạn số lần thử tối đa từ 2 đến 3 lần và nêu rõ các điều kiện thoát. Tiêu chí lựa chọn là “các nhiệm vụ đạt một lần và tỷ lệ trả lời đúng dưới 80%”, và nếu độ chính xác cao hơn mức đó thì mức độ cải thiện sẽ không lớn mặc dù chi phí tăng lên.

Thuật ngữ liên quan