Lập nhóm đỏ là một phương pháp đánh giá cố tình thử các tình huống và đầu vào độc hại từ quan điểm của kẻ tấn công nhằm xác minh tính an toàn và lỗ hổng của hệ thống AI.
Ban đầu là một thuật ngữ tập thể dục được quân đội và các cơ quan tình báo sử dụng, nó đề cập đến "huấn luyện tấn công tổ chức của chính mình từ vị trí của kẻ thù". Trong lĩnh vực AI, nó đề cập đến quá trình thực hiện các cuộc tấn công có chủ ý như bẻ khóa, tiêm nhanh và tạo ra nội dung có hại chống lại LLM và các hệ thống AI thế hệ để xác định trước các rủi ro vượt qua các thiết bị an toàn, rò rỉ thông tin và đầu ra có hại. Trong các hoạt động thực tế vào năm 2026, sự kết hợp giữa các cuộc tấn công thủ công và tự động hóa (AI tạo sinh một lượng lớn đầu vào thù địch) sẽ là xu hướng chủ đạo và chi phí trung bình của việc thuê gia công cho một nhà cung cấp chuyên môn bên ngoài sẽ dao động từ 50 đến 2 triệu yên Nhật cho việc xác minh mô hình quy mô nhỏ và vài triệu yên Nhật cho việc đánh giá toàn diện trước khi triển khai LLM quy mô lớn. Cạm bẫy lớn nhất trong lĩnh vực này là nghĩ mọi thứ như "làm một lần là xong" và bạn sẽ phải làm lại mỗi khi cập nhật mô hình, tinh chỉnh mô hình hoặc thay đổi lời nhắc. Trong các trường hợp công cụ bảo mật được ReviewAI theo dõi, ngày càng có nhiều công ty kết hợp nhóm đỏ vào CI/CD liên tục của họ song song với việc xây dựng các nguyên tắc AI.