ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Tấn công trích xuất mô hình

Tấn công trích xuất mô hình là một cuộc tấn công mạng nhằm phân tích hành vi của mô hình AI bằng cách thực hiện một số lượng lớn truy vấn và xây dựng một cách gian lận một "mô hình bóng" bắt chước mô hình ban đầu.

Tấn công trích xuất mô hình là phương pháp trong đó kẻ tấn công đưa ra một số lượng lớn lời nhắc vào một mô hình AI đóng, thu thập các cặp đầu vào/đầu ra và xây dựng lại "mô hình bóng" gần giống với mô hình ban đầu. Mục đích là để đánh cắp tài sản trí tuệ và đạt được lợi thế cạnh tranh bằng cách tránh chi phí sử dụng API. Tính đến năm 2026, các cuộc tấn công nhắm vào dòng GPT-4o và Claude 3 đã được chứng minh ở cấp độ nghiên cứu và tiêu chuẩn ngành cho các biện pháp đối phó tại chỗ đang hội tụ thành biện pháp phòng thủ ba lớp: (1) giới hạn tốc độ truy vấn, (2) không tiết lộ xác suất đầu ra và (3) công nghệ hình mờ. Trong hoạt động thực tế của dịch vụ LLM thương mại được ReviewAI theo dõi, đã có báo cáo về các trường hợp có thể bắt chước một mô hình cỡ trung bình với hàng chục nghìn truy vấn và chi phí bảo vệ trung bình là 30.000 đến 300.000 yên Nhật mỗi tháng (bao gồm các công cụ giám sát WAF +). Chúng tôi khuyến nghị nên tích hợp các dịch vụ API vào các yêu cầu bảo mật ngay từ giai đoạn thiết kế.

Thuật ngữ liên quan