ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

AgentBench (Băng đánh giá agent)

AgentBench là điểm chuẩn sử dụng LLM (Mô hình ngôn ngữ quy mô lớn) để hoạt động như một agent trong nhiều môi trường như mã hóa, trò chơi và hoạt động web, đồng thời đánh giá khả năng thực hiện các tác vụ trên nhiều mặt.

AgentBench là điểm chuẩn đánh giá agent LLM do Đại học Thanh Hoa (THUDM) đề xuất và được biết đến như một khuôn khổ để đo lường khả năng hoàn thành nhiệm vụ trong tám môi trường đa dạng như vận hành hệ điều hành, vận hành cơ sở dữ liệu, biểu đồ tri thức, trò chơi thẻ kỹ thuật số, tìm kiếm trên web và mua sắm. Nó được đặc trưng bởi khả năng đánh giá chéo không chỉ độ chính xác QA đơn lẻ mà còn cả "hành vi với tư cách là một agent" chẳng hạn như lập kế hoạch nhiều bước, gọi công cụ và phản ánh phản hồi từ môi trường. Trong các hoạt động thực tế kể từ năm 2026, ngay cả những mô hình có điểm chuẩn cao cũng thường được chỉ ra tại hiện trường là có “khoảng cách khái quát về môi trường”, trong đó hiệu suất giảm đáng kể trong các môi trường không xác định như cộng tác công cụ nội bộ hoặc môi trường API độc quyền. Hơn nữa, vì việc xây dựng và vận hành môi trường đánh giá đòi hỏi chi phí tính toán nên thông lệ tiêu chuẩn trong lĩnh vực này là sử dụng các kết quả điểm chuẩn công khai như AgentBench làm giá trị tham chiếu khi chọn sản phẩm nội bộ và chuẩn bị một bộ đánh giá riêng của riêng bạn gần với trường hợp sử dụng thực tế.

Thuật ngữ liên quan