Bẻ khóa nhiều lần là một phương pháp tấn công dần dần phá vỡ các biện pháp kiểm soát bảo mật của LLM bằng cách điền vào lời nhắc một số lượng lớn các ví dụ đối thoại giả mạo cho phép các hành động bị cấm.
Bẻ khóa nhiều lần là một phương thức tấn công lợi dụng cửa sổ ngữ cảnh dài của mô hình ngôn ngữ quy mô lớn và liên tục nhập hàng chục đến hàng trăm đoạn hội thoại giả cho phép các hành động bị cấm, khiến mô hình hiểu sai rằng ``phản hồi kiểu này được cho phép'' và bỏ qua các biện pháp bảo mật. Kể từ năm 2026, các mô hình có cửa sổ ngữ cảnh với hàng trăm nghìn mã thông báo sẽ trở thành xu hướng phổ biến và số lượng ví dụ sai mà kẻ tấn công có thể đưa vào sẽ tăng lên, khiến rủi ro tương đối cao. Trong các hoạt động thực tế, các biện pháp đối phó bao gồm phát hiện sự bất thường về số lượng mã thông báo đầu vào và phát hiện các mẫu lặp lại trong lịch sử hội thoại được áp dụng rộng rãi như các biện pháp bảo vệ, nhưng do việc phát triển logic phát hiện đòi hỏi chi phí bổ sung nên phải đưa ra lựa chọn cũng xem xét có nên giới thiệu các công cụ bảo mật AI chuyên dụng hay không.