Các điểm chính của bài viết này BFCL là một thử nghiệm công khai chỉ đo lường xem liệu AI có thể gọi chính xác các công cụ bên ngoài hay không. Điểm số là ''trung bình đơn giản của các hạng mục nhỏ'' được gọi là Độ chính xác tổng thể và không có trọng số. Nếu bạn không biết điều này, bạn sẽ hiểu sai thứ hạng. Các khả năng được kiểm tra ở V1 đến V4 là khác nhau. Mô hình tốt nhất thay đổi tùy thuộc vào việc đó là một cuộc gọi hay nhiều lượt kéo dài các cuộc hội thoại. Các con số cho cùng một mô hình có thể không khớp nhau tùy thuộc vào trang tổng hợp. Câu trả lời đúng là nhìn vào mức độ chênh lệch và ngày đo thay vì bản thân thứ hạng.
Hộp thông tin Ban biên tập
Miễn phí (bản thân điểm chuẩn là công khai/nguồn mở)
Xem bảng xếp hạng và thu thập dữ liệu đều miễn phí.
Dự án Gorilla của UC Berkeley
V4 (cập nhật lần cuối trên màn hình bảng xếp hạng chính thức 2026-04-12)
Độ chính xác của các lệnh gọi hàm LLM (các lệnh gọi công cụ bên ngoài)
Các câu hỏi chủ yếu bằng tiếng Anh. Cần có xác minh riêng cho công việc dạy tiếng Nhật.
Không có API ở phía điểm chuẩn. Định dạng chạy mã đánh giá trong môi trường của riêng bạn
Có thể được thực thi cục bộ mà không cần lưu trữ dữ liệu công ty ra bên ngoài
Xác nhận lần cuối: Ngày 1 tháng 8 năm 2026 bởi ban biên tập
Khi cố gắng tập hợp một AI agent, cơ sở để chọn mô hình là “vì nó có danh tiếng tốt”. Tình trạng này có lẽ khá phổ biến.
Chỉ số bạn nên xem xét là BFCL. BFCL là một tiêu chuẩn công khai nhằm đo lường xem AI có thể gọi các công cụ và chức năng bên ngoài bằng tên và đối số chính xác hay không. Được xuất bản bởi Dự án Gorilla của UC Berkeley.
Vấn đề không phải là khả năng đọc văn bản hay lượng kiến thức. Chỉ có một điểm được đo. Câu hỏi đặt ra là liệu AI có thể sử dụng các công cụ này một cách hợp lý hay không.
BFCL là gì? Một bài kiểm tra chung về cách sử dụng các công cụ do UC Berkeley xuất bản
BFCL là viết tắt của Bảng xếp hạng gọi hàm Berkeley và là một nền tảng đánh giá được tạo ra để so sánh khả năng gọi hàm của các LLM cạnh nhau.
Gọi hàm đề cập đến một cơ chế trong đó AI trả về các hướng dẫn có cấu trúc chẳng hạn như ``Chạy hàm này với các đối số này'' thay vì tự viết văn bản. Khi được hỏi về thời tiết, hãy gọi API thời tiết; khi được hỏi về hàng tồn kho, hãy gọi DB hàng tồn kho. Đây gần như là cơ sở của cái mà chúng ta gọi là agent.
Điều gì sẽ xảy ra nếu điều này sụp đổ? AI tự tin gọi sai hàm và trả về câu trả lời hợp lý dựa trên kết quả sai. Từ góc độ người dùng, nó không thể phân biệt được với hoạt động bình thường. Đây là cách tồi tệ nhất để phá vỡ.
Đó là lý do tại sao BFCL hoàn toàn không đánh giá “hình thức” của câu trả lời. Tên hàm có đúng không? Các loại đối số có đúng không? Bạn có đang gọi cho ai đó khi lẽ ra ngay từ đầu bạn không nên gọi cho họ không? Việc chấm điểm được tóm tắt thành ba loại này.
Trước hết, xin lưu ý rằng mục đích này khác với các tiêu chuẩn cạnh tranh về tính tự nhiên của cuộc trò chuyện.
Tại sao độ chính xác của lệnh gọi hàm lại hiệu quả nhất trong hệ thống kinh doanh?
Khi chạy AI nội bộ, nơi xảy ra tai nạn không phải là ở khâu tạo văn bản. Đây là thời điểm bạn chạm vào một hệ thống bên ngoài.
Ngay cả khi bạn gặp phải một số tiếng Nhật khó xử khi trò chuyện, công việc của bạn vẫn không dừng lại. Tuy nhiên, nếu một hàm "xóa" được gọi mà nghĩ rằng đó là hàm "get" thì đó là một vấn đề.
Cụ thể, nó phát huy tác dụng trong những tình huống như thế này.
- Khi ủy thác AI truy vấn cơ sở dữ liệu nội bộ, nếu các đối số điều kiện tìm kiếm bị trộn lẫn thì tất cả kết quả sẽ được trả về.
- Khi gọi quy trình phê duyệt, nếu bạn thay đổi ID mục tiêu theo một thì mục khác sẽ được phê duyệt.
- Khi gọi API SaaS bên ngoài, số lần thử lại sẽ tích lũy và phí sẽ tăng do thiếu đối số bắt buộc.
- Tạo một hàm trông giống như vậy và gọi nó để đáp lại một yêu cầu mà ngay từ đầu không có hàm nào để gọi.
Điều thứ tư khá rắc rối. Có thể thành thật nói rằng "chức năng tương ứng không tồn tại"? BFCL đo lường điều này như một mục độc lập.
Cuộc thảo luận về việc kiểm tra việc sử dụng AI trong công ty từ góc độ quản lý được tóm tắt trong Cách chọn công cụ AI cho kiểm toán nội bộ. Nếu bạn đọc phần này cùng với phần thảo luận về đánh giá, bạn sẽ dễ dàng xác định được mức độ tự động hóa được phép.
Tôi cũng muốn đọc nó
TypingMind là gì? Giá và các tùy chọn lựa chọn bắt đầu từ $39 (phiên bản 2026)
TypingMind là màn hình trò chuyện một lần, nơi bạn có thể sử dụng nhiều AI bằng khóa API của riêng mình. Chúng tôi đã sắp xếp các nội dung của Tiêu chuẩn $39, Mở rộng $79 và Cao cấp $99, phiên bản Nhóm bắt đầu từ $83 mỗi tháng, nơi lưu dữ liệu và mức độ bạn có thể sử dụng miễn phí bằng cách sử dụng thông tin chính thức kể từ tháng 8 năm 2026.
Ngày 7 tháng 8 năm 2026
14 bài toán và giải pháp triển khai AI trong các công ty xây dựng và ngành xây dựng
Phải mất nửa ngày để tạo ước tính và bạn có thể thu thập 20 báo cáo hàng ngày. Chúng tôi đã sắp xếp 14 vấn đề gặp phải khi giới thiệu AI trong ngành xây dựng dưới dạng Hỏi đáp. Hầu hết các nguyên nhân không nằm ở hiệu suất của AI mà nằm ở cách nó được phân phối. Nó bao gồm bản tóm tắt chi tiết về báo cáo hàng ngày, cách bắt đầu sau một tuần, chi phí khoảng 3.000 yên Nhật mỗi tháng và những điểm cần lưu ý về trợ cấp.
Ngày 7 tháng 8 năm 2026
Điều gì đã thay đổi trong BFCL từ V1 sang V4?
Ngay cả với cùng một "BFCL", những thứ nó đo lường cũng khác nhau tùy theo phiên bản. Nếu bạn trộn lẫn những điểm này lại với nhau thì cuộc thảo luận sẽ không ăn khớp với nhau.
Bảng sau đây tóm tắt các đặc điểm của từng dòng.
| loạt | chủ đề trung tâm | Nguồn gốc của câu hỏi | phán đoán phù hợp |
|---|---|---|---|
| V1 | Cuộc gọi chức năng đơn | Dữ liệu tổng hợp được thiết kế bằng tay | Cú pháp chính xác cơ bản |
| V2 trực tiếp | Cuộc gọi duy nhất tương tự như sử dụng thực tế | Lời nhắc thực tế do người dùng gửi | Dung sai đối với ngôn ngữ hiện trường |
| V3 | Đối thoại nhiều chiều | Tổng hợp + Kịch bản điều chỉnh bất lợi | Bảo toàn bối cảnh trong các cuộc hội thoại |
| V4 | Đã thêm trục đánh giá theo định hướng agent | Bao gồm và mở rộng những điều trên | Chuẩn bị cho các ứng dụng di chuyển tự động |
Nói cách khác, nếu đó là cộng tác API một lần thì số đó là V1 hoặc V2 Live và nếu đó là trợ lý hoạt động trong khi tương tác thì đó là V3 trở lên.
Bộ dữ liệu Live của V2 rất đặc biệt. Vì tài liệu dựa trên lời nhắc do người dùng thực tế đặt ra nên các câu hỏi đều dựa trên tư vấn thực tế. Ví dụ: nội dung được kết hợp với nội dung dành riêng cho doanh nghiệp, chẳng hạn như cách thiết kế mức giá SaaS của riêng bạn bằng cách so sánh giá của đối thủ cạnh tranh.
Những điểm yếu không được bộc lộ trong những câu hỏi được tổ chức tốt sẽ được bộc lộ ở đây.
V3 có một hướng đi khác. Nó được thiết kế để hỏi đồng thời suy luận, theo dõi ngữ cảnh và gọi công cụ trong nhiều lượt đối thoại. Hơn nữa, các câu hỏi được điều chỉnh để mang tính đối nghịch, nghĩa là chúng được sắp xếp có chủ ý theo cách giúp AI dễ dàng bị cuốn vào hơn.
V4 là dòng sản phẩm mới nhất được bổ sung tính năng đánh giá giống như agent. Màn hình bảng xếp hạng chính thức được cập nhật lần cuối vào ngày 12 tháng 4 năm 2026. Thông tin chi tiết của loạt phim dễ dàng thay đổi, vì vậy khi thực sự sử dụng nó để đưa ra quyết định tuyển dụng, tốt nhất bạn nên xem trực tiếp bảng xếp hạng chính thức của Gorilla và kiểm tra ngày cập nhật.
Cách đọc điểm — Độ chính xác tổng thể là “trung bình của các mức trung bình”
Độ chính xác tổng thể là điểm đáng chú ý nhất trong bảng xếp hạng. Thật nguy hiểm khi so sánh những con số này mà không biết định nghĩa của chúng.
Độ chính xác tổng thể của BFCL được tính bằng mức trung bình không trọng số của tất cả các phân loại phụ. Phân loại có số lượng lớn câu hỏi và phân loại có số lượng câu hỏi ít đều có hiệu quả như nhau.
Điều này có nghĩa là gì?
Nếu các hạng mục liên quan trực tiếp đến mục đích của bạn chỉ chiếm một phần nhỏ trong tổng số thì điểm tổng thể gần như vô nghĩa đối với bạn. Điều thường xảy ra là mô hình được xếp hạng tổng thể đầu tiên lại được xếp hạng thứ ba trong phân loại áp dụng cho doanh nghiệp của bạn.
Bảng xếp hạng còn bao gồm các cột khác ngoài Tổng thể. Dưới đây là những ưu tiên cho việc đọc:
| cột | nghĩa | Trọng lượng trong thực tế |
|---|---|---|
| Độ chính xác cho từng lớp con | Thành thạo các mục tương ứng với mục đích | Ưu tiên hàng đầu. Đây là thỏa thuận thực sự |
| Độ chính xác tổng thể | Trung bình đơn giản của tất cả các phân loại phụ | thẩm quyền giải quyết. Dùng để cắt chân |
| Trị giá | Chi phí ước tính (USD) trong suốt điểm chuẩn | Hiệu quả để so sánh tương đối chi phí vận hành |
| Độ trễ | Giây để phản hồi | Nếu có tính tương tác sẽ ảnh hưởng tới trải nghiệm. |
Nói cách khác, hãy bắt đầu với điểm tổng thể, sau đó quyết định dựa trên các danh mục phụ và chi phí. Cách tiếp cận hai bước này là thực tế.
Cột Chi phí thường bị bỏ qua nhưng ý nghĩa của nó rất rõ ràng. Chi phí ước tính bằng đô la để chạy toàn bộ điểm chuẩn. Điều này sẽ làm cơ sở để so sánh “cảm giác về chi phí cho cùng một khối lượng công việc” giữa các mô hình.
Nếu bỏ qua sự khác biệt giữa FC và Nhắc, bạn sẽ mắc sai lầm hoàn toàn trong việc lựa chọn.
Bảng BFCL sẽ có ký hiệu FC hoặc Nhắc bên cạnh tên model. Thật dễ dàng để đi qua nơi này ngay từ cái nhìn đầu tiên.
Ý nghĩa hoàn toàn khác.
- FC: Đo lường thời điểm mô hình thực hiện các lệnh gọi hàm
- Lời nhắc: Đo lường bằng cách sử dụng giải pháp tái tạo các lệnh gọi hàm bằng khả năng tạo câu thông thường cho các mô hình không có hỗ trợ riêng
Ngay cả khi có cùng tên model, điểm số của phiên bản FC và phiên bản Nhắc có thể giống nhau. Nếu bạn muốn so sánh, hãy sử dụng cùng một định dạng.
Bạn cần xác nhận việc triển khai của công ty bạn thuộc trường hợp nào.
| Hình thức thực hiện | dòng tương ứng | Những điểm cần lưu ý |
|---|---|---|
| Sử dụng đối số công cụ/chức năng API | F.C. | Dễ dàng phù hợp với cấu hình sản xuất |
| Viết JSON tại dấu nhắc và tự phân tích cú pháp | Lời nhắc | Hiệu suất của trình phân tích cú pháp không ảnh hưởng đến điểm số |
| Để nó vào khuôn khổ | Cần xác nhận | Bạn cần đọc cái nào để sử dụng nội bộ. |
Nói tóm lại, nếu bạn căn cứ mã của mình vào các số trong dòng khác với định dạng triển khai của bạn, bạn sẽ không thể tái tạo mã đó trong sản xuất.
Việc kiểm tra này đặc biệt quan trọng nếu bạn đang sử dụng cơ sở hạ tầng quy trình làm việc. Như đã đề cập trong phần so sánh giữa Dify và LangChain, lớp trừu tượng càng dày thì càng khó biết được tuyến đường nào đang được thực hiện trong nội bộ.
Các loại “vỡ” được biểu thị theo 4 loại của V3
Trong V3, các câu hỏi nhiều lượt được chia thành bốn loại. Mỗi cái được thiết kế để phá vỡ theo một cách khác nhau.
| loại | Những gì được hỏi | Triệu chứng thất bại |
|---|---|---|
| Căn cứ | Xử lý nhiều lượt tiêu chuẩn | Trộn lẫn các lập luận khi cuộc trò chuyện tiến triển |
| Cô Func | Các tình huống không cung cấp được các chức năng cần thiết | Giả mạo và gọi một hàm không tồn tại |
| Cô Param | Tình huống không có đối số cần thiết | Đoán và điền giá trị tùy ý |
| Bối cảnh dài | Xử lý với bối cảnh dài | Quên hướng dẫn ở nửa đầu |
Như bạn có thể thấy, câu trả lời đúng cho cô Func và cô Param là "đừng gọi/hỏi lại".
Những mô hình yếu kém trong lĩnh vực này hoạt động kinh doanh kém nhất. Mặc dù không có đủ thông tin nhưng họ không hỏi lại mà chỉ tạo ra những lý lẽ xác đáng và thực hiện chúng. Không ai để ý cho đến khi họ nhìn vào nhật ký.
Bối cảnh dài cũng không thể được đánh giá thấp. Trong cấu hình mà người dùng được yêu cầu đọc hướng dẫn nội bộ dài và sau đó gọi một công cụ, một mô hình hoạt động chỉ dựa trên nửa sau của ngữ cảnh sẽ xuất hiện.
Trước tiên, hãy quyết định danh mục nào mà công ty bạn sử dụng tương tự. Chỉ điều đó thôi cũng sẽ thay đổi cách nhìn của bảng xếp hạng.
Tóm tắt cho đến nay: BFCL chỉ đo lường ``khả năng sử dụng công cụ chính xác.'' Tổng số điểm là mức trung bình đơn giản của các hạng mục phụ, vì vậy bạn có thể xem trực tiếp hạng mục tương ứng với mục đích. FC và Nhắc được coi là những thứ khác nhau. Bốn loại V3, mỗi loại tương ứng với những cách phá vỡ khác nhau.
Điểm công khai tính đến tháng 7 năm 2026 là bao nhiêu?
Bây giờ hãy nói về những con số. Tuy nhiên, xin lưu ý một điều đầu tiên.
Nếu các nguồn tổng hợp khác nhau, các con số sẽ không khớp ngay cả khi tên điểm chuẩn giống nhau. Phiên bản khác nhau, các thông số mô hình được đánh giá khác nhau và ngày đo cũng khác nhau. Bởi vì ba mục này trùng nhau nên sẽ có vẻ mâu thuẫn khi nhiều tập hợp được đặt cạnh nhau.
Trước tiên, hãy bắt đầu với việc kiểm đếm công khai BFCL v3. Tính đến ngày 30 tháng 7 năm 2026, 23 mô hình đã được đánh giá với điểm trung bình là 58,5 và độ lệch chuẩn là 17,5. Các cấp bậc cao nhất là như thế này.
| người mẫu | Cung cấp bởi | Nhập $/M | Sản lượng $/M | BFCL v3 |
|---|---|---|---|---|
| Tư duy GLM 4.5 | Z AI | 0,600 USD | $2,200 | 76,7 |
| Claude Opus 4.7 | nhân loại | 5.000 USD | 25.000 USD | 76,6 |
| Bản xem trước Flash Lite của Gemini 3.1 | 0,250 USD | $1,500 | 76,5 | |
| Qwen3 32B Suy nghĩ | Alibaba | 0,080 USD | $0,280 | 75,7 |
Nói cách khác, dù chênh lệch điểm số giữa 4 mẫu dẫn đầu chỉ trong khoảng 1,0 điểm nhưng đơn giá đầu vào lại rộng hơn tới 60 lần.
Điều mà bảng này thể hiện rõ ràng nhất không phải là thứ hạng. Đối với các cuộc gọi chức năng, sự khác biệt về hiệu suất ở mức cao nhất rất hẹp đến mức nó không còn giải thích được sự khác biệt về giá.
Dòng V4 có giao diện khác. Về phía mô hình mở, Qwen3.5-397B-A17B đứng ở vị trí thứ hai chung cuộc với số điểm 0,729. Trong cùng thời gian, mô hình rẻ nhất trong top 10% là Qwen3,5-27B, với số điểm 0,30 USD trên một triệu mã thông báo đầu vào và số điểm là 0,685.
Trong một cuộc kiểm đếm V4 khác (cập nhật ngày 30 tháng 7 năm 2026, 9 mẫu), Qwen3.7 Max đứng đầu với 75,0%, tiếp theo là Qwen3.7 Plus với 72,9% và mẫu mở LFM2.5-8B-A1B với 49,7%.
Độ chi tiết của các con số và tham số không đồng đều. Vì vậy, sẽ là sai lầm nếu nói về thứ hạng bằng cách trộn lẫn các số liệu từ các tổng hợp khác nhau vào một bảng. Tất cả những gì bạn cần xem xét là sự khác biệt tương đối trong cùng một tổng thể.
Ngoài ra còn có một xu hướng rõ ràng là các mô hình mở đang bắt kịp. Tính đến đầu năm 2026, Qwen2.5 72B Instruct và DeepSeek V3 được đánh giá ngang hàng với GPT-4o trong nhiều cách phân loại lệnh gọi chức năng. Mistral Small 4 và Llama 4 Scout cũng có thể được xem xét.
Vị trí hiện tại của mô hình mở cũng được sắp xếp trong phần giải thích hệ thống Meta AI và Llama. Nếu bạn đang cân nhắc việc lưu trữ nội bộ, việc đọc phần đó trước tiên sẽ giúp thu hẹp các lựa chọn của bạn.
Claude là một chatbot AI được phát triển bởi Anthropic, hỗ trợ hiểu, tạo, tóm tắt và phân tích văn bản theo cách trò chuyện tự nhiên. Nó có thế mạnh trong việc đọc các văn bản dài và sắp xếp các vấn đề, đồng thời có thể tóm tắt nội dung giấy tờ, hợp đồng, báo cáo, biên bản, v.v. và rút ra những điểm và rủi ro quan trọng. Chúng tôi cũng có thể trợ giúp soạn thảo email, đề xuất và tài liệu kinh doanh, diễn giải văn bản và tư vấn về quy tắc. Nó phù hợp cho các cá nhân và người dùng doanh nghiệp muốn hợp lý hóa việc nghiên cứu, viết và tạo tài liệu kinh doanh đồng thời nhấn mạnh tính chính xác và giải thích chi tiết.
Các yếu tố chi phí và độ trễ thúc đẩy các quyết định
Nếu bạn quyết định cấu hình chỉ dựa trên điểm số, bạn sẽ hối hận khi nhìn thấy hóa đơn.
Chi phí và Độ trễ được liệt kê cùng nhau trong bảng xếp hạng BFCL. Chi phí là chi phí ước tính (bằng USD) để chạy toàn bộ điểm chuẩn và Độ trễ là thời gian phản hồi tính bằng giây.
Đối với mục đích agent, hai điều này hiệu quả hơn điểm số. Lý do rất đơn giản: agent gọi mô hình nhiều lần cho một yêu cầu.
Một yêu cầu của người dùng mất từ 3 đến 5 chuyến đi khứ hồi nội bộ để xác định lệnh gọi hàm, thực thi lệnh đó và diễn giải kết quả. Cả chênh lệch đơn giá và chênh lệch độ trễ đều được phản ánh trực tiếp trong hệ số nhân.
Đây là cách đánh giá nó:
- Nếu chênh lệch điểm số trong khoảng 1-2 điểm thì việc chọn phương án rẻ hơn không có vấn đề gì.
- Nếu chênh lệch điểm từ 5 điểm trở lên, hãy cân nhắc lựa chọn cao hơn ngay cả khi điều đó đồng nghĩa với chênh lệch giá.
- Nếu độ trễ hiển thị trong giao diện người dùng tương tác, hãy ưu tiên Độ trễ
- Nếu bạn không thể thấy thời gian chờ khi xử lý hàng loạt, hãy ưu tiên Chi phí
Ở bảng trên, 4 mẫu dẫn đầu đều cách nhau 1 điểm. Với dải này, thật khó để tìm ra lý do để không chọn một mẫu có đơn giá 0,080 USD.
Tuy nhiên, điều này chỉ áp dụng cho các lệnh gọi hàm. Nếu bạn tính đến chất lượng tóm tắt các văn bản dài và tính tự nhiên của tiếng Nhật, nhận định của bạn sẽ thay đổi. Vui lòng so sánh ChatGPT với Claude và Claude và Gemini để kiểm tra ưu nhược điểm của từng ứng dụng trước khi đưa ra quyết định.
ChatGPT là chatbot AI hỗ trợ trả lời câu hỏi, tạo văn bản, sắp xếp thông tin và tạo ý tưởng thông qua đối thoại tự nhiên. Bạn có thể thực hiện các tác vụ dựa trên văn bản như tóm tắt văn bản dài, soạn thảo email và đề xuất, dịch, diễn giải và sắp xếp chúng dưới dạng bảng trong khi trò chuyện. Chúng tôi còn cung cấp dịch vụ tạo mã lập trình, xác nhận nguyên nhân lỗi, giải thích nội dung học tập và tư vấn bằng hình ảnh. Nó phù hợp cho những người dùng muốn sử dụng nó cho nhiều mục đích khác nhau, từ nghiên cứu cá nhân đến hỗ trợ tạo và phát triển tài liệu kinh doanh.
Nếu lựa chọn mô hình có điểm BFCL cao thì việc kinh doanh của bạn có suôn sẻ không?
Nó không quay. Hãy để tôi nói rõ ở đây.
Biện pháp BFCL là liệu bạn có thể thực hiện lệnh gọi chính xác tới định nghĩa hàm được chuẩn bị trước hay không. Những vấn đề thực sự với hệ thống kinh doanh xảy ra trước và sau.
Liệt kê các lĩnh vực mà điểm chuẩn không xem xét.
| Điều cần thiết trong thực tế | Điều trị trong BFCL |
|---|---|
| Chất lượng thiết kế của chính định nghĩa hàm | Không áp dụng (giả sử định nghĩa đã cho) |
| Thẩm quyền quản lý/ phán quyết về việc có thực hiện hay không | Không áp dụng |
| Thử lại và khôi phục khi thất bại | Không áp dụng |
| Giải thích thuật ngữ kinh doanh tiếng Nhật | Hầu như nằm ngoài phạm vi (câu hỏi chủ yếu bằng tiếng Anh) |
| Tên viết tắt và tên sản phẩm dành riêng cho công ty | Không áp dụng |
Nói cách khác, BFCL có thể được sử dụng làm điểm khởi đầu cho việc lựa chọn mô hình, nhưng không thể được sử dụng cho quyết định cuối cùng.
Trong nhiều trường hợp, điều có hiệu quả trong lĩnh vực này không phải là sự khác biệt trong các mô hình mà là cách viết định nghĩa hàm. Tên đối số không rõ ràng, phần giải thích chỉ có một dòng và có ba hàm giống nhau liên tiếp. Ở trạng thái này, độ chính xác sẽ không đạt được cho dù bạn mang theo model nào.
Trước khi theo đuổi các con số chuẩn, hãy đảm bảo rằng định nghĩa hàm của bạn được con người đọc và không bị nhầm lẫn. Hiệu ứng ở đây lớn hơn.
Có nhiều lĩnh vực ngay từ đầu đã không có tiêu chuẩn công khai. Một ví dụ điển hình là tạo hình ảnh và khi chọn công cụ tạo hình minh họa hoặc so sánh ComfyUI và Stable Diffusion, bạn không có lựa chọn nào khác ngoài việc đánh giá dựa trên các mẫu đầu ra và tính dễ vận hành, thay vì các con số. Những khu vực có số lượng khá may mắn.
Tôi có thể áp dụng trực tiếp kết quả BFCL vào công việc tiếng Nhật của mình không?
Nó nguy hiểm như nó vốn có. Các câu hỏi BFCL chủ yếu bao gồm tiếng Anh.
Có khoảng ba vấn đề bổ sung xảy ra khi hoạt động bằng tiếng Nhật.
- Sự mơ hồ trong các hạt làm cho không rõ nên đặt giá trị nào vào đối số nào
- Do ngôn ngữ kính trọng và uyển ngữ nên rất khó để đánh giá đó là lời yêu cầu hay sự xác nhận.
- Chuẩn hóa các số có chiều rộng đầy đủ, lịch tiếng Nhật và các biểu thức tương đối như "cuối tháng trước" không thành công.
Cái thứ ba là phổ biến nhất trong thực tế. Trong quá trình chuyển đổi "đơn đặt hàng nhận được vào cuối tháng trước" thành ngày bằng số, sự khác biệt giữa các mô hình trở nên rõ ràng.
Giải pháp rất đơn giản: tạo 20 đến 30 bài kiểm tra nhỏ bằng cách sử dụng dữ liệu thực tế của Nhật Bản. Chúng tôi sẽ sử dụng cấu trúc danh mục của BFCL như hiện tại và chỉ thay thế các câu hỏi bằng tiếng Nhật của công ty chúng tôi.
Nếu bạn muốn thấy sự khác biệt trong kỹ năng tìm kiếm và tóm tắt AI của Nhật Bản, bài viết giải thích của Felo sẽ rất hữu ích. Bạn có thể thấy rằng thói quen xử lý ngôn ngữ tiếng Nhật thay đổi đáng kể tùy thuộc vào dịch vụ.
Các bước để đo lại bằng phương pháp BFCL cho trường hợp sử dụng của riêng bạn
Khi bạn đã thu hẹp các lựa chọn của mình xuống còn ba dựa trên điểm số công khai, bạn có thể tự mình đánh giá phần còn lại. Các bước không quá nặng.
- Mang theo 5 đến 10 định nghĩa hàm sẽ được sử dụng trong sản xuất
- Thu thập 30 phát ngôn thực tế của người dùng và viết thủ công nội dung cuộc gọi chính xác
- Trộn 20-30% số câu hỏi tương ứng với Miss Func và Miss Param.
- Thực thi trên mô hình ứng cử viên và kiểm tra tỷ lệ khớp của tên hàm và đối số cho mỗi phân loại.
Đừng bỏ qua điều thứ ba. Nếu chỉ đo hệ thống thông thường thì tất cả các mẫu đều có điểm cao và không có sự khác biệt.
Một kiểm đếm được cung cấp cho mỗi loại. Thời điểm bạn tóm tắt nó thành điểm tổng thể, bạn sẽ rơi vào cạm bẫy tương tự như Độ chính xác tổng thể của BFCL.
Là môi trường thực thi để đánh giá, nó được xây dựng nhanh chóng trên nền tảng quy trình công việc. Ngay cả những công cụ được đề cập trong phần so sánh giữa n8n và Zapier AI cũng đủ để thực hiện lặp lại đơn giản. Nếu bạn muốn làm cho nó phức tạp hơn, hãy xem so sánh giữa LangChain và LlamaIndex và quyết định phong cách nào phù hợp với công ty của bạn.
Ban biên tập Phán quyết
BFCL là một chuẩn mực có giá trị cho những ai xây dựng AI agent. Thiết kế tập trung vào một điểm, lệnh gọi hàm và nó tạo ra sự khác biệt mà sự thông minh tổng thể không thể nhận thấy được. Đặc biệt, ý tưởng Miss Func và Miss Param của V3 rất đặc biệt và các điểm chuẩn khác không tập trung vào việc đo lường độc lập liệu bạn có thể quyết định không gọi hay không.
Mặt khác, thực sự là không tốt nếu sử dụng bảng xếp hạng làm cơ sở để tuyển dụng. Vì Độ chính xác tổng thể là mức trung bình đơn giản của các danh mục nhỏ nên số một tổng thể không phải là số một cho mục đích của bạn. Ngoài ra, các con số không nhất quán cho từng trang web tổng hợp. Ngay cả tính đến cuối tháng 7 năm 2026, đội hình hàng đầu của v3 và v4 đã khác nhau.
Chỉ có một cách sử dụng thực tế. Điều này sẽ được sử dụng làm điểm khởi đầu để thu hẹp số ứng viên xuống còn ba và quyết định cuối cùng sẽ được đưa ra bằng cách kiểm tra 30 dữ liệu nội bộ. Đây là điều ít có khả năng thất bại nhất.
Giờ đây, chênh lệch điểm số ở nhóm dẫn đầu chỉ trong vòng 1 điểm, không còn lý do gì để chọn một mẫu đắt tiền chỉ dựa trên độ chính xác của lệnh gọi chức năng. Sự khác biệt là ở giá cả và độ trễ.
Xem các so sánh/lựa chọn thay thế liên quan
Việc lựa chọn mô hình không chỉ được xác định bởi độ chính xác của các lệnh gọi hàm. Vui lòng kiểm tra so sánh theo ứng dụng.
- ChatGPT vs Claude - Sự khác biệt về khả năng sử dụng tổng thể như một cuộc trò chuyện có mục đích chung
- Claude vs Gemini - Cân bằng chi phí và xử lý văn bản dài
- DeepSeek vs Llama - So sánh hiệu suất giữa các mô hình mở
- Dify vs LangChain — Chọn nền tảng xây dựng agent
- LangChain vs LlamaIndex - Sự khác biệt trong triết lý thiết kế bao gồm tích hợp tìm kiếm
- Claude Code vs Cursor - Sự khác biệt trong trải nghiệm gọi công cụ tại địa điểm phát triển
- GLM 5.2 vs Qwen3.6 Plus — Ứng viên triển khai với điểm cao
Nếu bạn muốn tìm kiếm theo danh mục, tốt nhất nên bắt đầu với AI Agent và LLM.
Gemini là trợ lý AI tương tác do Google cung cấp và là chatbot AI hỗ trợ trả lời câu hỏi, viết câu, tóm tắt và tạo ý tưởng dưới dạng trò chuyện. Nó có thể đọc nội dung không chỉ từ văn bản mà còn từ hình ảnh và tệp, đồng thời có thể được sử dụng để sắp xếp các điểm chính của tài liệu, văn bản email nháp, cách diễn đạt lại cụm từ, v.v. Nó cũng hỗ trợ các câu trả lời dựa trên thông tin tìm kiếm của Google và tích hợp với các dịch vụ của Google như Gmail, Google Docs và Google Drive. Đối với các cá nhân và nhóm thường làm việc hoặc học tập trong môi trường Google, ưu điểm là dễ dàng thực hiện từ nghiên cứu đến sáng tạo trong cùng một quy trình.
Các câu hỏi thường gặp (FAQ)
H. Tôi có thể sử dụng BFCL miễn phí không?
Đúng. Xem bảng xếp hạng và lấy bộ dữ liệu đánh giá là miễn phí. Vì mã đánh giá chạy trong môi trường của riêng bạn nên bạn có thể xác minh dữ liệu nội bộ mà không cần gửi dữ liệu đó cho bên ngoài. Tất cả những gì cần thiết là phí sử dụng API cho mô hình mục tiêu.
H. Sự khác biệt giữa BFCL và MMLU là gì?
Khả năng đang được đo lường là khác nhau. MMLU là bài kiểm tra trắc nghiệm nhằm kiểm tra kiến thức trong nhiều lĩnh vực. BFCL không xem xét kiến thức mà xem xét độ chính xác của các thao tác, chẳng hạn như liệu bạn có thể gọi các hàm bên ngoài một cách chính xác hay không. BFCL là yếu tố quyết định việc sử dụng agent.
Q.Tôi nên xem số nào, FC hay Nhắc?
Đây là một trong những phù hợp với việc thực hiện của bạn. Sử dụng FC nếu bạn muốn sử dụng đối số công cụ của API hoặc Nhắc nếu bạn muốn viết JSON tại dấu nhắc và tự phân tích cú pháp. Việc trộn lẫn và so sánh kết quả sẽ dẫn đến những kết luận không thể tái hiện trong đời thực.
Câu hỏi: Tôi nên chọn mô hình nào với số điểm chênh lệch vài điểm?
Nếu chênh lệch 1-2 điểm thì máy rẻ hơn hoặc máy phản hồi nhanh hơn không có vấn đề gì. Sự khác biệt trong nhóm các cuộc gọi chức năng hàng đầu là rất chặt chẽ và theo kiểm đếm công khai vào cuối tháng 7 năm 2026, bốn mô hình hàng đầu đều nằm trong khoảng 1,0 điểm. Nếu bạn đang mở từ 5 điểm trở lên thì đáng để xem xét top đầu.
Q. Điểm BFCL có hữu ích cho việc học tiếng Nhật không?
Điều này sẽ hữu ích cho đến khi bạn thu hẹp ứng viên. Tuy nhiên, vì các câu hỏi chủ yếu bằng tiếng Anh nên nó không đo lường được sự mơ hồ chỉ có ở tiếng Nhật hoặc cách xử lý lịch và ngày tháng tương đối của tiếng Nhật. Vui lòng tiến hành 20 đến 30 bài kiểm tra bổ sung sử dụng dữ liệu thực tế bằng tiếng Nhật trước khi vận hành thực tế.
Câu hỏi: Việc gọi các hàm ngay cả trong mô hình mở có thực tế không?
Nó là đủ tùy thuộc vào mục đích. Tính đến đầu năm 2026, Qwen2.5 72B Instruct và DeepSeek V3 được đánh giá ít nhất bằng GPT-4o trong nhiều phân loại. Đây là một ứng cử viên nếu bạn muốn giảm chi phí với dịch vụ lưu trữ nội bộ.
Q. Tôi có nên chỉ nhìn vào V4 không?
Nó phụ thuộc vào việc sử dụng. Đối với cộng tác API một lần, phân loại Trực tiếp V1 và V2 gần với tình huống thực tế hơn và đối với các cấu hình nơi công việc được thực hiện trong khi tương tác, hãy xem V3 trở lên. V4 là phiên bản mới nhất nhưng có thể không phù hợp với nhu cầu sử dụng của bạn.
Hỏi. Tôi nên kiểm tra kết quả benchmark của mình bao lâu một lần?
Một lần một phần tư là đủ. Tuy nhiên, ngay trước khi đưa mẫu máy mới vào sản xuất, hãy đảm bảo chạy lại 30 cuộc thử nghiệm của công ty bạn. Việc quản lý ngày cập nhật điểm công khai và ngày xác minh cuối cùng trong công ty của bạn là an toàn.
Sau khi xác nhận tính chính xác của các lệnh gọi hàm, bước tiếp theo là chọn một nền tảng để chạy trên nền tảng đó. Điều tiếp theo cần đọc là so sánh giữa Dify và LangChain. Điều này là do quyết định xây dựng agent nội bộ hay sử dụng nền tảng có sẵn sẽ ảnh hưởng đến chi phí vận hành nhiều hơn việc lựa chọn mô hình.
Trang web chính thức của từng công cụ (thông tin chính)
Giá cả, chức năng và phạm vi hỗ trợ là thông tin chính được cung cấp bởi trang web chính thức của mỗi công ty. Bài viết này dựa trên xác minh tại thời điểm xuất bản, nhưng hãy nhớ kiểm tra từng trang chính thức để biết các điều kiện chính xác và mới nhất.
- Claude — Trang web chính thức (xem chi tiết)
- ChatGPT — Trang web chính thức (xem chi tiết)
- Gemini — Trang web chính thức (xem chi tiết)
- Dify — Trang web chính thức (xem chi tiết)
- LangChain — Trang web chính thức (xem chi tiết)
Bài viết liên quan
- 10 AI agent được đề xuất và cách chọn | Hiểu mọi thứ từ sự khác biệt với thế hệ AI đến giá thị trường (phiên bản 2026)
- Cách chọn giải pháp thay thế cho MonkeyLearn — So sánh 4 loại: miễn phí, tiếng Nhật và mã nguồn mở (phiên bản 2026)
- Gọi hàm là gì? Hướng dẫn đầy đủ về cơ chế, cách triển khai và mức phí để AI thao tác với các API bên ngoài
- 7 công cụ AI được đề xuất cho tài sản tiền điện tử và blockchain [mới nhất năm 2026]
- Ghế bán hàng tự động là gì? Bạn có thể học được gì khi giao việc quản lý máy bán hàng tự động cho AI 365 ngày một năm (phiên bản 2026)