τ-bench là điểm chuẩn đánh giá thống kê khả năng sử dụng công cụ và thực hiện các tác vụ nhiều bước của AI agent trong một tình huống thực tế.
τ-bench là điểm chuẩn đánh giá AI agent được Sierra AI công bố vào năm 2024. Đo lường xem người dùng và agent có thể hoàn thành nhiệm vụ dịch vụ khách hàng (miền bán lẻ/hàng không) hay không bằng cách gọi một công cụ trong nhiều tương tác. Không giống như các băng ghế thông thường đặt câu hỏi về tính chính xác của các câu trả lời một lần, nó sử dụng chỉ số pass^k (τ-thành công) cho biết ``số lần thực hiện thành công cùng một nhiệm vụ sau khi thử k lần'' và được đặc trưng bởi khả năng phân biệt rõ ràng giữa các mô hình mỗi lần bắn và các AI agent thực sự ổn định.
Trong hoạt động thực tế vào năm 2026, ngay cả với các mẫu lớp GPT-4o và Claude 3.7 Sonnet, τ-thành công thường sẽ duy trì ở mức khoảng 40 đến 70% và nó đang thu hút rất nhiều sự chú ý trong lĩnh vực này như một phương tiện để hình dung các vấn đề "trông có vẻ ổn trong bản demo nhưng lại thất bại trong quá trình sản xuất thực tế". Ngay cả trong các trường hợp được ReviewAI xác nhận, mô hình ``điểm cục bộ cao → giảm một nửa hiệu suất thực tế'' vẫn thường xuyên xảy ra. Một cạm bẫy phổ biến là đơn giản hóa quá mức các tình huống kiểm tra, dẫn đến điểm số cao hơn thực tế. Đánh giá chính xác yêu cầu định nghĩa công cụ và mã quản lý trạng thái gần với dữ liệu sản xuất và mất từ 1 đến 3 tuần để thiết lập. Bắt đầu từ quy mô nhỏ là khó khăn vì chỉ riêng chi phí API để chạy đủ số lượng thử nghiệm đã lên tới hàng chục nghìn yên Nhật. Hiện tại, nó được coi là tiêu chuẩn công nghiệp về độ tin cậy của agent và OpenAI và Anthropic cũng xuất bản nó dưới dạng chỉ mục tham khảo.