ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

BFCL (đánh giá cuộc gọi chức năng)

BFCL là điểm chuẩn đánh giá lệnh gọi hàm nhằm đo lường xem LLM (Mô hình ngôn ngữ quy mô lớn) có thể gọi chính xác các công cụ và API bên ngoài hay không tùy theo tình huống.

BFCL được xuất bản bởi UC Berkeley và được coi là một trong những tiêu chuẩn đánh giá tiêu chuẩn ngành để đo lường xem LLM có thể gọi chính xác các chức năng và API bên ngoài tùy theo tình huống hay không. Ngoài việc gọi một hàm duy nhất, nó còn có đặc điểm là khả năng gọi song song nhiều hàm, khả năng gọi nhiều hàm liên tiếp trong khi vẫn duy trì ngữ cảnh và thậm chí khả năng không gọi khi không tồn tại một hàm thích hợp. Trong hoạt động thực tế kể từ năm 2026, ngay cả khi mô hình có vị trí cao trên bảng xếp hạng, độ chính xác có thể thấp hơn mong đợi khi áp dụng cho các định nghĩa công cụ hoặc thông số kỹ thuật API độc quyền mà công ty thực sự sử dụng và phương pháp coi điểm BFCL là giá trị tham chiếu thay vì giá trị tuyệt đối được áp dụng rộng rãi trong lĩnh vực này. Ngoài ra, không thể bỏ qua thời gian và công sức cần thiết để xác minh lại bằng cách sử dụng bộ đánh giá duy nhất mỗi khi xem xét một mô hình, cũng như chi phí gọi API để đánh giá, do đó, việc xác định số tiền cần đầu tư vào đánh giá tự động dựa trên tâm lý thị trường được cho là một điểm thực tế khi lựa chọn một mô hình trong lĩnh vực này.

Thuật ngữ liên quan