Căn chỉnh AI là một quy trình thiết kế và công nghệ nhằm điều chỉnh đầu ra và hành vi của AI phù hợp với ý định, giá trị và tiêu chuẩn an toàn của con người.
Căn chỉnh AI đề cập đến lĩnh vực kỹ thuật chung nhằm điều chỉnh đầu ra và hành động của LLM để chúng không đi chệch khỏi mục đích đã định của nhà phát triển/người dùng hoặc các tiêu chuẩn an toàn xã hội. Có ba phương pháp tiêu chuẩn ngành được áp dụng rộng rãi: RLHF, sử dụng phản hồi của con người làm tín hiệu khen thưởng, các phương pháp dựa trên AI theo Hiến pháp, có AI đánh giá đầu ra của một AI khác và các lớp lan can, ngăn chặn các phản hồi có hại hoặc sai lệch. Trong hoạt động thực tế kể từ năm 2026, ngay cả với các mô hình đã căn chỉnh, các lời nhắc dài và nhiệm vụ của nhân viên nhiều bước được biết là có những cạm bẫy dẫn đến hành vi ngoài ý muốn (coi thường một phần hướng dẫn và tuân thủ quá mức) có thể xảy ra. Trong lĩnh vực này, việc không tin tưởng đầu ra vô điều kiện và áp dụng cách tiếp cận hai giai đoạn gồm nhiều đánh giá của con người và các sản phẩm lan can đã trở thành tiêu chuẩn. Nhìn chung, chi phí tự mình thực hiện điều chỉnh căn chỉnh có xu hướng cao, ngay cả đối với các công ty lớn, do đó, lựa chọn phổ biến ở các địa điểm vừa và nhỏ chỉ đơn giản là áp dụng các mô hình đã điều chỉnh (Claude / GPT / Gemini, v.v.) do các nhà cung cấp lớn cung cấp và bổ sung cho họ các thiết kế và lan can nhanh chóng.