ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Tấn công cửa sau

Tấn công cửa sau là một cuộc tấn công mạng nhúng các thiết bị độc hại vào dữ liệu học tập và trọng lượng của mô hình AI, chỉ gây ra các trục trặc ngoài ý muốn khi nhập một trình kích hoạt cụ thể.

Tấn công cửa sau là một loại phương thức tấn công đối nghịch nhằm đưa mục đích xấu vào giai đoạn huấn luyện của mô hình học máy. Hệ thống hoạt động bình thường để đáp ứng với đầu vào thông thường, nhưng khi nhận được đầu vào có chứa "trình kích hoạt" (một mẫu cụ thể, chuỗi ký tự, vùng hình ảnh, v.v.) do kẻ tấn công đặt trước, nó sẽ gây ra trục trặc dự kiến, chẳng hạn như phân loại sai, rò rỉ thông tin hoặc leo thang đặc quyền. Đặc điểm lớn nhất của vấn đề này là cực kỳ khó phát hiện trong giai đoạn thử nghiệm, vì không có bất thường nào trong hoạt động bình thường của mô hình.

Trong hoạt động thực tế vào năm 2026, các trường hợp mua các mô hình được đào tạo trước bên ngoài và bộ dữ liệu tinh chỉnh từ bên thứ ba đang gia tăng nhanh chóng và việc đưa các cửa hậu vào giai đoạn đó gây ra rủi ro lớn nhất. Có nhiều trường hợp mô hình tải về từ các trung tâm mô hình thương mại được đưa vào sản xuất mà không được kiểm chứng.

Xét về giá trị thị trường trong lĩnh vực này, có những trường hợp việc giới thiệu và đánh giá các công cụ phát hiện chuyên dụng (phân tích hoạt động tế bào thần kinh, phát hiện sự bất thường theo cụm, v.v.) đòi hỏi nhiều giờ công từ hàng chục đến hàng triệu yên Nhật. Việc kết hợp ít nhất "kiểm tra mẫu kích hoạt" và "xác minh hành vi trên các bộ thử nghiệm" đang trở thành tiêu chuẩn cho các mô hình mua sắm bên ngoài.

ReviewAI nhấn mạnh rằng rủi ro này thường bị bỏ qua khi kết hợp LLM bên ngoài vào đường ống RAG và cấu hình agent. Phòng thủ nhiều lớp kết hợp kiểm soát xuất xứ mô hình, kiểm tra hành vi thường xuyên và vệ sinh đầu vào sẽ là phương pháp thực hành tốt nhất trong lĩnh vực này kể từ năm 2026.

Thuật ngữ liên quan