ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

AgentHarm (Ghế an toàn cho agent)

AgentHarm là một điểm chuẩn đo lường mức độ các AI agent thực hiện các nhiệm vụ có hại gồm nhiều bước như gian lận và tấn công mạng.

AgentHarm là một điểm chuẩn được công bố để đo lường mức độ mà các AI agent dựa trên LLM thực hiện các nhiệm vụ có hại gồm nhiều bước như lừa đảo, tấn công mạng và mua thuốc bất hợp pháp. Nó được đặc trưng bởi khả năng không chỉ từ chối một lời nhắc có hại duy nhất mà còn đánh giá khả năng tiến hành các hành động có hại theo cách đồng thuận thông qua các lệnh gọi công cụ lặp đi lặp lại. Nó được sử dụng rộng rãi trong các đánh giá an toàn khi chọn mô hình làm chỉ số để đo lường khả năng chống bẻ khóa duy nhất của agent. Trong hoạt động thực tế tính đến năm 2026, đã có báo cáo về các trường hợp trong đó các biện pháp an toàn bị bỏ qua ngay khi một mô hình có điểm chuẩn cao được kết hợp với một công cụ độc quyền hoặc RAG tại hiện trường và phương pháp tiến hành xác minh bổ sung cấu hình nội bộ thay vì dựa vào điểm số được công bố đang dần được thiết lập. Dựa trên chi phí trung bình để thiết lập môi trường đánh giá và yêu cầu kiểm toán bên ngoài, phương pháp lựa chọn tại chỗ là xác định mức độ kiểm tra, tùy thuộc vào việc cơ quan đó chỉ hoạt động nội bộ hay mở cửa cho công chúng.

Thuật ngữ liên quan