ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Tấn công đảo ngược mô hình

Tấn công đảo ngược mô hình là một cuộc tấn công vi phạm quyền riêng tư nhằm tính toán và khôi phục ngược dữ liệu cũng như thông tin cá nhân được sử dụng để học thông qua các truy vấn hàng loạt tới mô hình AI.

Tấn công đảo ngược mô hình là một phương pháp tấn công tái tạo lại các đặc điểm và thông tin cá nhân của dữ liệu huấn luyện bằng cách quan sát liên tục kết quả đầu ra (điểm dự đoán và giá trị xác suất) của mô hình học máy. Khái niệm này được Frederik Ding, v.v. đề xuất vào năm 2015, nhưng tính đến năm 2026, rủi ro đang gia tăng nhanh chóng do sự phổ biến của các API suy luận và hiệu suất ngày càng tăng của LLM.

Như một cạm bẫy trong hoạt động thực tế, ngày càng có nhiều trường hợp trong đó điểm cuối suy luận được công bố khi SaaS trở thành con đường rò rỉ thông tin không mong muốn. Đặc biệt, các báo cáo nghiên cứu cho thấy các mô hình nhận dạng khuôn mặt và mô hình được đào tạo trên dữ liệu y tế có thể khôi phục hình ảnh và thuộc tính cá nhân gần với dữ liệu đào tạo ban đầu sau hàng trăm đến hàng nghìn truy vấn. Về chi phí trong lĩnh vực này, có vẻ như việc thực hiện các biện pháp bảo vệ chính (áp dụng quyền riêng tư khác biệt, làm tròn điểm đầu ra, giới hạn tỷ lệ truy vấn) sẽ tăng thời gian phát triển từ 1 đến 2 tuần.

Nhiều nhà cung cấp được ReviewAI xác minh không tiết lộ đầy đủ chính sách bảo vệ mô hình của họ kể từ năm 2026, do đó cần phải xác nhận khi ký hợp đồng API. LLM cũng đã xác nhận các trường hợp tấn công phức hợp kết hợp với việc tiêm nhắc nhanh chóng và đây là mô hình mối đe dọa cần được đưa rõ ràng vào các đánh giá bảo mật.

Thuật ngữ liên quan