ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Băng ghế dự bị đầu cuối

Terminal-Bench là một tiêu chuẩn đánh giá nhằm đo lường mức độ AI agent có thể tự động thực hiện các nhiệm vụ thực tế trên thiết bị đầu cuối.

Terminal-Bench được tham chiếu rộng rãi trong cộng đồng nhà phát triển như một điểm chuẩn đánh giá để đo lường xem AI agent có thể tự động hoàn thành các tác vụ thực tế gồm nhiều bước như thao tác tệp, xây dựng và gỡ lỗi trong môi trường thiết bị đầu cuối Linux hay không. Nó khác với độ chính xác của việc tạo mã đơn giản ở chỗ nó được tính điểm dựa trên nhận thức về môi trường, khả năng phục hồi lỗi và sự phối hợp của các lệnh gọi công cụ. Người ta đã chỉ ra rằng trong hoạt động thực tế vào năm 2026, ngay cả những mô hình có điểm chuẩn cao thường sẽ không hoạt động như mong đợi ở những nơi làm việc có liên quan đến môi trường vỏ nội bộ không chuẩn và cài đặt quyền kế thừa. Về mặt chi phí, các mô hình yêu cầu nhiều nỗ lực hơn để hoàn thành một nhiệm vụ sẽ tiêu thụ nhiều mã thông báo hơn và xét về hiệu suất thị trường, các mô hình có điểm cao hơn có xu hướng có chi phí thực hiện cho mỗi nhiệm vụ cao hơn. Khi giới thiệu một hệ thống, bạn nên kiểm tra không chỉ giá trị tuyệt đối của điểm mà còn cả số lần thử trung bình để hoàn thành một nhiệm vụ và tỷ lệ thời gian chờ, đồng thời chọn các điều kiện gần với môi trường hoạt động của công ty bạn.

Thuật ngữ liên quan