τ²-bench là một tiêu chuẩn đánh giá nhằm đo lường mức độ chính xác của AI agent có thể thực hiện các nhiệm vụ kết hợp nhiều lượt tương tác và lệnh gọi công cụ.
τ²-bench là một tiêu chuẩn đánh giá được thiết kế để đo lường tỷ lệ thành công của các AI agent và tính hợp lệ của các quy trình trong các nhiệm vụ xen kẽ giữa tương tác của người dùng và các cuộc gọi công cụ, chẳng hạn như dịch vụ khách hàng và công việc hỗ trợ văn phòng. Không giống như các điểm chuẩn kiểu QA một lần, nó được đặc trưng bởi thực tế là nó bao gồm đánh giá quản lý trạng thái qua nhiều lượt và khả năng phục hồi sau các lệnh gọi công cụ không chính xác. Trong hoạt động thực tế tính đến năm 2026, người ta đã chỉ ra rộng rãi rằng ngay cả khi một mô hình có điểm công khai cao, nếu định nghĩa công cụ độc quyền hoặc định dạng lỗi API của công ty khác với mong đợi, thì tỷ lệ thành công trong lĩnh vực này sẽ giảm đáng kể. Hơn nữa, không thể đánh giá thấp chi phí chạy các bộ đánh giá mỗi khi thay đổi cấu hình mô hình hoặc agent, bao gồm không chỉ phí API mà còn cả số giờ công cần thiết để xem xét nhật ký thủ công và được cho là tiêu tốn hàng chục nghìn yên Nhật trong giờ công ngay cả đối với xác minh quy mô nhỏ. Khi chọn một mô hình tại hiện trường, bạn nên đánh giá lại không chỉ điểm chuẩn công khai mà còn cả kịch bản gần với sự phân bổ nhiệm vụ của công ty bạn.