AgentDojo là một điểm chuẩn mở đo lường khả năng chống lại các AI agent LLM trước các cuộc tấn công tiêm nhiễm nhanh chóng trong khi chạy các công cụ.
AgentDojo là một điểm chuẩn được thiết kế để đo lường mức độ mạnh mẽ của các AI agent LLM trước các hành vi tiêm nhắc độc hại nhận được thông qua các công cụ và tài liệu bên ngoài, đồng thời khuôn khổ của nó để đánh giá định lượng tỷ lệ tấn công thành công bằng cách sử dụng nhiều vùng nhiệm vụ và kiểu tấn công được cho là được tham chiếu rộng rãi như một tiêu chuẩn ngành. Kể từ năm 2026, khi việc sử dụng AI dựa trên agent thực tế ngày càng mở rộng, nó đang thu hút rất nhiều sự chú ý như một phương tiện trực quan hóa các lỗ hổng chẳng hạn như “làm theo hướng dẫn được nhúng trong đầu ra của công cụ” vốn không thể nhìn thấy trong các đánh giá LLM độc lập. Tuy nhiên, về mặt chi phí tại chỗ, mặc dù bản thân việc thực thi điểm chuẩn là nguồn mở và miễn phí, nhưng điều đáng tiếc là chi phí lệnh gọi API có thể tích lũy do sự kết hợp của nhiều kịch bản và mô hình nhằm đánh giá toàn diện agent mục tiêu. Hơn nữa, ngay cả khi điểm cao, khả năng chống tấn công sẽ khác nhau tùy thuộc vào cài đặt của môi trường sản xuất thực tế, do đó, những người trong hiện trường nên đánh giá lại bằng cách sử dụng một kịch bản tương tự với cấu hình công cụ của riêng họ thay vì chỉ dựa vào điểm số.