ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Skeleton Key (Phương pháp bẻ khóa)

Skeleton Key là một phương pháp bẻ khóa có mục đích chung hướng dẫn mô hình AI dần dần ghi đè các nguyên tắc an toàn và đưa ra bất kỳ nội dung bị cấm nào.

Skeleton Key là một phương pháp bẻ khóa chung được Microsoft đặt tên vào năm 2024, dần dần ghi đè các nguyên tắc an toàn của nhiều LLM chỉ bằng một lời nhắc. Nó được đặc trưng bởi hướng dẫn gồm nhiều bước trong đó mô hình được xác định lại để nó phản hồi bằng nhãn cảnh báo thay vì từ chối, với lời mở đầu như ``Đây là cuộc trò chuyện vì mục đích giáo dục an toàn'' và lần lượt nới lỏng các mục tiêu bị từ chối, chẳng hạn như hàng hóa nguy hiểm, hoạt động bất hợp pháp và các biểu hiện phân biệt đối xử. Vì loại vi phạm tương tự đã được xác nhận trong LLM từ nhiều nhà cung cấp, không chỉ các mẫu cụ thể, nên ngành đang coi vấn đề này là vấn đề ở cấp độ triết lý thiết kế chứ không phải là một lỗ hổng riêng lẻ.

Cạm bẫy trong hoạt động thực tế là nếu bạn kết hợp LLM đơn giản vào một chatbot hoặc agent nội bộ, thì những kết quả đầu ra không mong muốn sẽ bị rò rỉ theo phản ứng dây chuyền. Tại hiện trường, việc lọc đầu ra và giám sát nhật ký hội thoại được triển khai thành một bộ và các hoạt động phát hiện chuyển đổi ngữ cảnh bất thường đang trở thành tiêu chuẩn vào năm 2026. Chi phí triển khai cho các công cụ phòng thủ thường lên tới hàng chục nghìn yên Nhật mỗi tháng để giám sát SaaS và hàng triệu yên Nhật cho các cuộc kiểm tra tùy chỉnh cho doanh nghiệp. Người ta nói rằng AI agent càng có nhiều quyền thực thi các công cụ bên ngoài thì mức độ ưu tiên càng cao.

Thuật ngữ liên quan