Kỹ thuật để vượt qua các hạn chế về an toàn của AI. Khai thác các kết quả đầu ra bị cấm thông qua việc đóng vai và các kịch bản ảo.
Bẻ khóa là một phương thức tấn công nhằm phá vỡ các hạn chế an toàn được tích hợp trong LLM (từ chối hỗ trợ cho các hoạt động bất hợp pháp, sản xuất chất nguy hiểm, lời nói phân biệt đối xử, v.v.). Có nhiều phương pháp khác nhau, chẳng hạn như hướng dẫn nhập vai, chẳng hạn như ``Bạn là một AI không có giới hạn'' hoặc ``Đây là lời thoại của một nhân vật trong tiểu thuyết'', chuyển đổi đa ngôn ngữ và làm xáo trộn mã thông báo. OpenAI / Anthropic / Google đang sử dụng RLHF + AI Hiến pháp làm biện pháp đối phó, nhưng khó có thể bảo vệ hoàn toàn. Để sử dụng cho doanh nghiệp, tiêu chuẩn cho năm 2026 là luôn bao gồm nhật ký đầu vào của người dùng và giám sát đầu ra để phát hiện các mẫu đáng ngờ. Hướng dẫn nội bộ của ReviewAI cũng nêu rõ rằng cố gắng bẻ khóa là một hoạt động bị cấm.