AI hiến pháp là một phương pháp đào tạo gợi ra những phản ứng an toàn và có đạo đức bằng cách đưa ra cho mô hình AI một danh sách các nguyên tắc cần tuân theo (hiến pháp) và yêu cầu nó liên tục chỉ trích và sửa đổi chính nó.
AI hiến pháp là một công nghệ an toàn được Anthropic công bố vào năm 2022. Đây là phương pháp cung cấp cho các mô hình AI một bộ nguyên tắc (hiến pháp) như ``tránh đầu ra có hại'' và ``không sử dụng các biểu thức phân biệt đối xử'' và yêu cầu các mô hình liên tục tự phê bình và cải thiện bản thân. RLHF thông thường (Học tăng cường phản hồi của con người) yêu cầu người gắn nhãn đánh giá trực tiếp các kết quả đầu ra có hại, nhưng với AI Hiến pháp, phản hồi của chính AI (RLAIF) chịu trách nhiệm phần lớn, giúp việc đào tạo có thể mở rộng và chi phí thấp trở nên khả thi.
Tính đến năm 2026, tác phẩm nổi tiếng nhất là loạt phim Claude của Anthropic. Cạm bẫy lớn nhất trong quá trình thực thi trên thực tế là “tính chính xác của việc diễn đạt bằng lời của hiến pháp”. Nếu các nguyên tắc quá thô thiển, việc tự kiểm duyệt quá mức và sự từ chối vô ý sẽ xảy ra thường xuyên. Tiêu chuẩn ngành là một chu trình trong đó các nguyên tắc được các chuyên gia trong lĩnh vực soạn thảo tại hiện trường và được xác nhận định kỳ thông qua hàng trăm đánh giá.
ReviewAI đã biết được một số trường hợp trong đó các công ty đặt ra chính sách nội bộ cho AI hỗ trợ khách hàng của họ, chẳng hạn như ``không chỉ trích đối thủ cạnh tranh'' và ``không xin lỗi ngoài quy định hoàn tiền'' và đã cải thiện đáng kể tỷ lệ tuân thủ chính sách thương hiệu. Theo ước tính của thị trường vào năm 2026, việc triển khai đầy đủ theo mô hình nội bộ sẽ tiêu tốn từ 1 triệu đến 5 triệu yên Nhật mỗi tháng, nhưng số lượng trang web có thể đạt được hiệu ứng tương tự với chi phí thấp hơn bằng cách thiết kế lời nhắc hệ thống API đang tăng lên nhanh chóng.