Các điểm chính của bài viết này LiveBench là bài kiểm tra khả năng LLM nhằm ngăn chặn hiện tượng ``AI ghi nhớ các câu hỏi trước đây và đạt điểm cao'' bằng cách thay đổi câu hỏi định kỳ. Nó không sử dụng AI để chấm điểm mà thay vào đó xác định câu trả lời đúng một cách máy móc thông qua xử lý công thức toán học và thực hiện bài kiểm tra nên điểm mạnh của nó là ít biến động về điểm số. Tuy nhiên, các câu hỏi tập trung vào toán học cạnh tranh và mã hóa giống agent, đồng thời thứ hạng được hoán đổi với hiệu suất công việc hàng ngày. Nếu bạn đang chọn một mô hình nội bộ, câu trả lời đúng là sử dụng LiveBench làm "sàng lọc sơ bộ" và đưa ra quyết định cuối cùng dựa trên dữ liệu của chính bạn.
Hộp thông tin Ban biên tập
Miễn phí (mã dữ liệu đánh giá nguồn mở)
Bất cứ ai cũng có thể xem bảng điểm miễn phí. Bản thân công cụ này có thể tự chạy miễn phí
Bản thân LiveBench không có API. Cần có phí API riêng cho mô hình mục tiêu đánh giá.
Không đủ điều kiện để được chứng nhận (vì đây là tập dữ liệu nghiên cứu)
Có thể trong các điều kiện giấy phép. Chủ yếu được sử dụng để đánh giá nội bộ
Bạn có thể chạy nó trong tầm tay bằng cách tải xuống tập dữ liệu
Quản lý hợp tác mở bởi cộng đồng nghiên cứu
Xác nhận lần cuối: Ngày 28 tháng 7 năm 2026 bởi ban biên tập
Khi tôi mở bảng xếp hạng để chọn mô hình AI thì mỗi trang đều có một vị trí số một khác nhau. Hơn nữa, các con số đều là số 90 nên tôi không biết nên tin vào con số nào. Có lẽ có nhiều người mắc kẹt trong tình huống đó.
Một trong những thủ phạm của sự nhầm lẫn này là ô nhiễm điểm chuẩn. LiveBench là bảng xếp hạng hiếm hoi trực tiếp giải quyết vấn đề này, đó là lý do tại sao bảng xếp hạng lại khác với các bảng khác. Khi bạn hiểu lý do của sự khác biệt, bạn sẽ có thể đọc bảng xếp hạng ngay lập tức.
LiveBench là gì?
LiveBench là điểm chuẩn được tạo ra để đo lường khả năng của các mô hình ngôn ngữ quy mô lớn (LLM) và có các câu hỏi thay đổi thường xuyên. Mục đích là để tránh tình trạng AI ghi nhớ câu trả lời.
Tóm lại, điểm chuẩn là các bài kiểm tra phổ biến có thể được giải quyết bằng AI. Tương tự như bài kiểm tra thành tích học tập, mọi người đều được hỏi những câu hỏi giống nhau và điểm số của họ sẽ được so sánh.
Vấn đề là bài kiểm tra chung này được công khai. Nếu câu hỏi và câu trả lời được đăng trực tuyến, AI tiếp theo sẽ đọc chúng dưới dạng dữ liệu học tập. Đối với con người, nó không khác gì việc làm bài kiểm tra sau khi đọc hết phiếu trả lời trước khi làm bài.
Trong thế giới nghiên cứu, tình trạng này được gọi là ô nhiễm bộ thử nghiệm. Bảng xếp hạng bị ô nhiễm chỉ đo lường “bạn đã tiếp thu được bao nhiêu câu hỏi trong quá khứ” chứ không phải mức độ thông minh của bạn.
Các nhà thiết kế của LiveBench đã hoàn toàn tin tưởng vào cấu trúc ở đây. Các câu hỏi được tạo ra từ “các nguồn thông tin mới” như các bài báo, bài báo và câu hỏi cạnh tranh được xuất bản gần đây và được thay đổi đều đặn. Việc ghi nhớ sẽ không có tác dụng vì các câu hỏi đã được kiểm tra trước khi nhập dữ liệu học tập.
"Trực tiếp" trong tên có nghĩa là phát sóng trực tiếp. Ý tôi không phải là một tập dữ liệu đóng mà là một bài kiểm tra liên tục chuyển động.
Một khi bạn hiểu được triết lý thiết kế này, ba nguyên tắc tiếp theo sẽ dễ dàng phát huy tác dụng.
Bạn tóm tắt ba nguyên tắc thiết kế của LiveBench như thế nào?
LiveBench được xây dựng trên ba trụ cột: cập nhật câu hỏi, tính điểm khách quan và tính đa dạng của lĩnh vực. Nếu thiếu một trong số đó, thứ hạng sẽ bị bóp méo.
Chính sách thiết kế được công bố có thể được tóm tắt thành ba điểm sau.
- Cập nhật câu hỏi thường xuyên Tạo câu hỏi mới từ các nguồn gần đây và thay thế chúng thường xuyên. Một hệ thống giúp loại bỏ độ trễ thời gian mà các mô hình từ vài tháng trước có lợi thế.
- Đừng để AI ghi điểm cho bạn. Tôi sẽ giải thích điều này sau, nhưng đây là điểm khác biệt lớn nhất. Chỉ những câu hỏi mà câu trả lời đúng có thể được xác định một cách máy móc mới được đưa ra và phán đoán được tự động hóa.
- Trải rộng các lĩnh vực chủ đề Chúng tôi sẽ chia các câu hỏi thành nhiều loại để các câu hỏi không chỉ tập trung vào toán học hay chỉ về mã. Đây là lý do tại sao có cả điểm tổng thể và điểm cụ thể theo lĩnh vực.
Dưới đây là bảng liệt kê ba. Mục đích của thiết kế trở nên rõ ràng khi bạn xem xét những thách thức mà mỗi thiết kế giải quyết.
| nguyên tắc thiết kế | Những thách thức đang được giải quyết | Nó có ý nghĩa gì với người đọc |
|---|---|---|
| Thay đổi câu hỏi thường xuyên | Trộn câu trả lời vào dữ liệu đào tạo | Điểm cao = ít nghi ngờ hơn về khả năng ghi nhớ |
| Tự động chấm điểm dựa trên câu trả lời đúng khách quan | Phân loại sở thích và biến động của AI | Ngay cả khi bạn đo cùng một mô hình hai lần, các điểm không dễ dàng di chuyển |
| Bao gồm nhiều lĩnh vực | Các vấn đề sẽ giúp bạn xếp hạng tổng thể đầu tiên dựa trên chuyên môn của bạn | Bạn có thể chọn một mô hình phù hợp với mục đích của mình dựa trên điểm số của từng lĩnh vực cụ thể. |
Nói cách khác, con số của LiveBench gần bằng "có bao nhiêu vấn đề bạn có thể giải quyết vào thời điểm này mà bạn chưa từng thấy trước đây". Đây chính là điểm khác biệt mang tính quyết định so với các bảng xếp hạng khác.
Tôi cũng muốn đọc nó
TypingMind là gì? Giá và các tùy chọn lựa chọn bắt đầu từ $39 (phiên bản 2026)
TypingMind là màn hình trò chuyện một lần, nơi bạn có thể sử dụng nhiều AI bằng khóa API của riêng mình. Chúng tôi đã sắp xếp các nội dung của Tiêu chuẩn $39, Mở rộng $79 và Cao cấp $99, phiên bản Nhóm bắt đầu từ $83 mỗi tháng, nơi lưu dữ liệu và mức độ bạn có thể sử dụng miễn phí bằng cách sử dụng thông tin chính thức kể từ tháng 8 năm 2026.
Ngày 7 tháng 8 năm 2026
14 bài toán và giải pháp triển khai AI trong các công ty xây dựng và ngành xây dựng
Phải mất nửa ngày để tạo ước tính và bạn có thể thu thập 20 báo cáo hàng ngày. Chúng tôi đã sắp xếp 14 vấn đề gặp phải khi giới thiệu AI trong ngành xây dựng dưới dạng Hỏi đáp. Hầu hết các nguyên nhân không nằm ở hiệu suất của AI mà nằm ở cách nó được phân phối. Nó bao gồm bản tóm tắt chi tiết về báo cáo hàng ngày, cách bắt đầu sau một tuần, chi phí khoảng 3.000 yên Nhật mỗi tháng và những điểm cần lưu ý về trợ cấp.
Ngày 7 tháng 8 năm 2026
Tại sao “không bị ô nhiễm” lại quan trọng đến vậy?
Điểm chuẩn bị ô nhiễm đo lường dữ liệu huấn luyện thay vì hiệu suất của mô hình. Điều đáng lo ngại nhất trong thực tế là việc vô tình chọn được vị trí số một trên bảng xếp hạng, để rồi nhận ra rằng công việc của công ty bạn không như mong đợi của bạn.
Chỉ cần tưởng tượng. Giả sử một người mẫu đạt điểm 95 trong một bài kiểm tra toán nổi tiếng. Kết quả tuyệt vời. Nhưng điều gì sẽ xảy ra nếu bài toán và câu trả lời mẫu đó đã có sẵn trên mạng trong ba năm?
Việc phá vỡ 95 điểm có thể là khả năng tư duy hoặc trí nhớ. Tôi không thể nhận ra sự khác biệt.
Và tất nhiên, các nhiệm vụ được đưa ra tại nơi làm việc là những nhiệm vụ mới chưa có trong dữ liệu học tập. 95 điểm bạn kiếm được từ trí nhớ thậm chí không bằng 1 điểm.
Một vấn đề khác là tình trạng ô nhiễm diễn ra âm thầm. Khi một điểm chuẩn trở nên nổi tiếng hơn, số lượng bài viết giải thích về nó sẽ tăng lên và những lời giải thích đó sẽ trở thành dữ liệu huấn luyện cho mô hình tiếp theo. Cấu trúc bắt đầu xấu đi ngay khi nó trở nên phổ biến.
Sở dĩ LiveBench liên tục thay thế các vấn đề là để khắc phục tình trạng xuống cấp này trong hoạt động. Sẽ mất thời gian, nhưng không còn cách nào khác.
Ý tưởng này cũng có thể được sử dụng khi đánh giá nội bộ các công cụ AI. Thay vì thử nghiệm bằng các câu hỏi mẫu thường gặp, hãy thử sử dụng các tài liệu dành riêng cho công ty của bạn. Đó là logic tương tự. Các cuộc thảo luận về việc kết hợp AI vào hoạt động kiểm tra nội bộ được tóm tắt trong phần Sử dụng AI trong hoạt động kiểm toán nội bộ, có thể dùng làm tài liệu tham khảo cho thiết kế đánh giá.
Những loại vấn đề sẽ xảy ra?
LiveBench chia lĩnh vực này thành nhiều danh mục và chuẩn bị các câu hỏi theo những cách khác nhau cho từng danh mục. Nó được đặc trưng bởi sự nhấn mạnh vào toán học và mã hóa cạnh tranh.
Các danh mục được chia thành các mục sau: Toán học, mã hóa, lý luận, phân tích dữ liệu, làm theo hướng dẫn và các nhiệm vụ dựa trên ngôn ngữ.
Điều thú vị là cách các câu hỏi được xây dựng. Ví dụ, trong các bài tập liên quan đến ngôn ngữ, một định dạng được sử dụng trong đó các câu được xuất bản gần đây được sắp xếp lại một cách máy móc và câu hỏi được yêu cầu "đưa chúng trở lại trật tự ban đầu". Vì bản thân văn bản là mới nên không có cách nào để ghi nhớ nó.
Viết mã bao gồm việc thực sự viết mã và sau đó chạy mã kiểm tra để đánh giá xem nó có vượt qua hay không. Bạn sẽ không nhận được điểm cho lời giải thích như vậy.
Bảng dưới đây tóm tắt mục tiêu của từng loại. Vui lòng xem để biết mức độ sử dụng của công ty bạn gần với danh mục nào.
| loại | cái gì đang được đo | Phản ứng gần đúng tại nơi làm việc |
|---|---|---|
| toán học | Khả năng giải quyết các vấn đề ở cấp độ cạnh tranh | Logic tính toán phức tạp, thiết kế thuật toán |
| mã hóa | Khả năng viết mã làm việc | Triển khai, sửa lỗi, tạo thử nghiệm |
| suy luận | Khả năng rút ra kết luận từ tiền đề | Phán quyết có nhiều điều kiện, tổ chức yêu cầu |
| phân tích dữ liệu | Khả năng xử lý bảng và dữ liệu có cấu trúc | Tổng hợp, báo cáo và trích xuất |
| Tuân thủ hướng dẫn | Khả năng tuân thủ các điều kiện chi tiết | Đầu ra ở định dạng tiêu chuẩn |
| ngôn ngữ | Khả năng nắm bắt cấu trúc của câu | Tóm tắt, chỉnh sửa, hiệu đính |
Nói cách khác, nếu bạn chỉ nhìn vào điểm tổng thể, cấu trúc sẽ sao cho những mô hình giỏi toán và viết mã có xu hướng đứng đầu. Nếu bạn không biết điều này và đưa thứ hạng tổng thể vào tác phẩm của mình thì sau này bạn sẽ gặp rắc rối.
Bạn thực hiện việc chấm điểm như thế nào?
LiveBench không sử dụng AI để chấm điểm. Toán học sử dụng hệ thống xử lý công thức để xác minh tính tương đương và mã hóa liên quan đến việc thực hiện các trường hợp kiểm thử để xác định đạt/không đạt.
Đây là phần khác biệt nhất so với các bảng xếp hạng khác.
Nhiều điểm chuẩn trong những năm gần đây đã áp dụng một phương pháp gọi là "LLM-as-a-thẩm phán" (Thẩm phán AI), phương pháp này sử dụng mô hình mạnh để chấm điểm các câu trả lời. Thật dễ dàng, nhưng nó có ba nhược điểm.
- Điểm cao được trao cho phong cách viết được AI chấm điểm ưa thích.
- Nếu bạn chấm cùng một câu trả lời hai lần, điểm có thể thay đổi.
- Không thể đánh giá chính xác những câu trả lời thông minh hơn người chấm điểm
LiveBench đã loại bỏ hoàn toàn điều này. Tôi tự đặt ra cho mình một ràng buộc là chỉ đặt những câu hỏi mà câu trả lời đúng được xác định một cách máy móc.
Ngay cả khi đáp án toán là x = 2/3 hoặc x = 0,666... nếu bạn chạy nó thông qua hệ thống xử lý công thức, bạn có thể xác định rằng chúng có cùng giá trị. Hoặc mã chạy hoặc không. Không có chỗ cho sự chủ quan.
Sự đánh đổi là phạm vi câu hỏi bạn có thể đặt ra sẽ bị thu hẹp hơn. Không thể đo lường những nhiệm vụ mà không thể xác định được câu trả lời đúng, chẳng hạn như “Viết lại đề xuất này để nó hấp dẫn hơn”.
Ưu điểm và nhược điểm là hai mặt của cùng một đồng tiền. Xem bảng so sánh dưới đây.
| Cách tính điểm | Điểm mạnh | Nhược điểm | Ví dụ điển hình |
|---|---|---|---|
| Tính điểm tự động khách quan | Độ tái lập cao, không tùy tiện | Chỉ những câu hỏi có câu trả lời đúng duy nhất mới có thể được hỏi. | LiveBench |
| Chấm điểm bởi trọng tài AI | Mô tả miễn phí cũng có thể được đo lường | Phụ thuộc vào thói quen của người ghi bàn | Nhiều điểm chuẩn mới nổi |
| bỏ phiếu của con người | Gần gũi với cảm giác | Sở thích có ảnh hưởng lớn và chi phí cao | Hình thức đấu trường cạnh tranh |
Nói cách khác, điểm LiveBench có đặc tính là "nghiêm ngặt nhưng có phạm vi hẹp". Ngay cả khi ai đó muốn biết kỹ năng viết câu nhìn vào nó cũng sẽ không đưa ra câu trả lời.
Sự khác biệt giữa LiveBench và các điểm chuẩn khác là gì?
LiveBench đo lường “khả năng tổng thể để giải quyết các vấn đề bạn chưa từng thấy trước đây” và SWE-bench đo lường “tỷ lệ thành công của các bản sửa lỗi thực tế”. Vì những thứ được đo lường là khác nhau nên đương nhiên là thứ hạng sẽ không trùng khớp.
Hãy sắp xếp đại khái các chỉ số thường được nói đến cạnh nhau.
SWE-bench Verify là một định dạng trong đó AI được sử dụng để sửa các lỗi được báo cáo trong phần mềm thực và điểm số được đưa ra dựa trên việc sửa lỗi có thành công hay không. Đó là công việc gần gũi nhất với công việc hàng ngày của một kỹ sư.
MMLU là một bài kiểm tra cổ điển đặt các câu hỏi trắc nghiệm về kiến thức trong nhiều lĩnh vực học thuật. Các mô hình hàng đầu đều gần đạt điểm tuyệt đối nên khó có thể nhận ra sự khác biệt.
GPQA Diamond là một câu hỏi khoa học cấp tiến sĩ. ARC-AGI-2 là một bài kiểm tra lý luận trừu tượng trong đó bạn suy ra các mẫu bạn chưa từng thấy trước đây.
Trong đấu trường cạnh tranh, con người bỏ phiếu để quyết định xem họ thích câu trả lời nào hơn. Mặc dù điều này gần với thực tế nhưng người ta đã chỉ ra rằng giọng điệu lịch sự và những câu trả lời dài có xu hướng mang lại lợi ích.
Bằng cách sắp xếp chúng theo cách này, vị trí của LiveBench trở nên rõ ràng.
| chỉ mục | Những gì đang được đo lường | Chống ô nhiễm | Ai nên xem nó? |
|---|---|---|---|
| LiveBench | Khả năng toàn diện để giải quyết các vấn đề chưa biết | Cao (hoán đổi câu hỏi) | Sàng lọc sơ bộ để lựa chọn mô hình |
| Đã xác minh băng ghế dự bị SWE | Tỷ lệ sửa lỗi thực tế thành công | vừa phải | Trưởng nhóm phát triển |
| Kim cương GPQA | lý luận khoa học tiên tiến | vừa phải | Chịu trách nhiệm nghiên cứu và khảo sát kỹ thuật |
| ARC-AGI-2 | suy luận mẫu trừu tượng | đắt | Các nhà nghiên cứu, những người muốn nhìn thấy tương lai |
| đấu trường cạnh tranh | sở thích của con người | Thấp | Những người coi trọng sự thoải mái khi đọc |
Nói cách khác, không một trong số đó là đúng. Câu trả lời đúng duy nhất là chọn bàn theo mục đích của bạn.
Tại sao có sự khác biệt giữa thứ hạng LiveBench và thực tiễn thực tế?
LiveBench tập trung nhiều vào toán học cạnh tranh và mã hóa giống agent, đồng thời các mô hình yếu ở hai lĩnh vực này sẽ bị tụt hạng trong bảng xếp hạng tổng thể. Khả năng sử dụng trong thực tế là một câu chuyện khác.
Một ví dụ điển hình của hiện tượng này được quan sát thấy vào năm 2026.
Mẫu máy có trọng lượng mở MiniMax M2.5 đứng thứ 27 trong bảng xếp hạng tổng thể của LiveBench. Tuy nhiên, trong SWE-bench Added, đo lường các bản sửa lỗi thực tế, nó đạt 80,2%, xếp ở vị trí thứ 4. Mô hình tương tự di chuyển 23 vị trí.
Tại sao? Điều này là do LiveBench được thiết kế để kiểm tra xem bạn có thể giải được các bài toán khó ở cấp độ IMO (Olympic Toán học Quốc tế) hay không. M2.5 không tốt ở điểm đó. Tuy nhiên, nó có thể xử lý nhiệm vụ sửa lỗi trong cơ sở mã thực tế.
Việc bảng xếp hạng chênh nhau tới 23 điểm là điều không có gì lạ. Chỉ là những gì đang được đo là khác nhau.
Nếu công việc bạn muốn giao phó cho AI trong công ty của bạn mang tính thực tế hơn, chẳng hạn như “trích xuất số liệu bán hàng hàng quý từ tài liệu” hay “sắp xếp biên bản cuộc họp thành định dạng chuẩn”, thì kết quả IMO gần như không liên quan. Thay vào đó, bạn nên xem xét điểm số theo phân loại để tuân thủ hướng dẫn và phân tích dữ liệu.
Đây là một cách thực tế để sử dụng nó. Bỏ qua điểm tổng thể và chỉ xem điểm cho các danh mục gần với mức sử dụng của công ty bạn. LiveBench cho phép bạn làm điều này vì nó công bố điểm số theo danh mục. Tổng số điểm chỉ đơn giản là tổng của nhiều môn học. Nếu bạn đã quyết định mình muốn học khoa nào, chỉ cần nhìn vào những điểm trong môn học đó.
Tóm tắt cho đến nay LiveBench là một chuẩn mực giúp loại bỏ khả năng ghi nhớ bằng cách thay thế các câu hỏi và loại bỏ sự biến động về điểm số bằng cách không sử dụng giám khảo AI. Thay vào đó, nó chỉ đặt những câu hỏi có câu trả lời đúng duy nhất và thiên về toán học và mã hóa nhiều hơn. Việc xếp hạng tổng thể không dựa trên khả năng làm việc. Cách chính xác để sử dụng nó là xem điểm số theo hạng mục.
Chúng ta nên đọc cân bằng năng lượng tính đến tháng 7 năm 2026 như thế nào?
Các mô hình chính được chia thành các khu vực dẫn dắt cho từng chỉ số. Ý tưởng chọn một "tổng thể tốt nhất" không còn giá trị nữa.
Nhìn vào bảng kiểm kê được công bố tính đến tháng 7 năm 2026, thứ hạng hàng đầu ở mỗi lĩnh vực là khác nhau.
Trong mã hóa cấp độ biên giới, Claude's Fable 5 đạt 95,0% trong SWE-bench Verify, đồng thời dẫn đầu trong HLE khó với 53,3%. Ở phần suy luận khoa học và suy luận trừu tượng, Gemini 3.1 Pro đạt 94,3% với GPQA Diamond và 77,1% với ARC-AGI-2. GPT-5.4 đang dẫn đầu trong lĩnh vực sử dụng máy tính, nơi máy tính có thể được vận hành trực tiếp.
Ngoài ra, nhóm trọng lượng mở đã thu hẹp khoảng cách về mã hóa. Băng ghế dự bị SWE của MiniMax M2.5 80,2% là mức hàng đầu cách đây không lâu.
| cánh đồng | Mẫu trước đó tính đến tháng 7 năm 2026 | Điểm tham chiếu |
|---|---|---|
| mã hóa biên giới | Truyện ngụ ngôn Claude 5 | Băng ghế dự bị SWE đã được xác minh 95,0% |
| Tổng hợp kiến thức các câu hỏi khó | Truyện ngụ ngôn Claude 5 | HLE 53,3% |
| lý luận khoa học | Gemini 3.1 Pro | Kim cương GPQA 94,3% |
| lý luận trừu tượng | Gemini 3.1 Pro | ARC-AGI-2 77,1% |
| Vận hành máy tính | GPT-5.4 | Dẫn đầu theo lĩnh vực |
| mã hóa trọng lượng mở | MiniMax M2.5 | Băng ghế dự bị SWE đã được xác minh 80,2% |
Các con số sẽ thay đổi vài tháng một lần. Xin vui lòng đọc bảng này với ngày tham khảo.
Nói cách khác, trên thực tế, tùy theo loại công việc nên sử dụng các mô hình khác nhau sẽ tốt hơn thay vì chỉ dựa vào một mô hình để làm mọi việc. Có thể thấy sự khác biệt về tính cách giữa ChatGPT và Claude bằng cách so sánh ChatGPT và Claude, đồng thời có thể thấy sự khác biệt trong cách sử dụng mã hóa một cách chi tiết bằng cách so sánh Mã Claude và Con trỏ.
Claude là một chatbot AI được phát triển bởi Anthropic, hỗ trợ hiểu, tạo, tóm tắt và phân tích văn bản theo cách trò chuyện tự nhiên. Nó có thế mạnh trong việc đọc các văn bản dài và sắp xếp các vấn đề, đồng thời có thể tóm tắt nội dung giấy tờ, hợp đồng, báo cáo, biên bản, v.v. và rút ra những điểm và rủi ro quan trọng. Chúng tôi cũng có thể trợ giúp soạn thảo email, đề xuất và tài liệu kinh doanh, diễn giải văn bản và tư vấn về quy tắc. Nó phù hợp cho các cá nhân và người dùng doanh nghiệp muốn hợp lý hóa việc nghiên cứu, viết và tạo tài liệu kinh doanh đồng thời nhấn mạnh tính chính xác và giải thích chi tiết.
Tôi có thể tự chạy LiveBench không?
Có thể. Tập lệnh đánh giá có sẵn trong kho lưu trữ chính thức và bạn có thể thực hiện mọi thứ từ tạo câu trả lời cho đến chấm điểm và hiển thị kết quả cùng một lúc.
Tập lệnh đã xuất bản được gọi là run_livebench.py và được gọi bằng cách chỉ định tên mô hình và phạm vi điểm chuẩn. Bạn cũng có thể thu hẹp các tùy chọn của mình, chẳng hạn như chỉ thử lĩnh vực mã hóa.
Dòng chảy rất đơn giản.
- Chỉ định mô hình được đánh giá
- Chỉ định phạm vi câu hỏi (lĩnh vực và ngày phát hành)
- Tạo câu trả lời → chấm điểm → hiển thị kết quả tự động chạy
Xây dựng môi trường và phí API là trách nhiệm của riêng bạn. Nếu bạn sử dụng model cao cấp ở tất cả các hạng mục thì bạn sẽ phải tốn một khoản tiền nhất định. Sẽ là khôn ngoan nếu bạn chỉ thử những lĩnh vực gần với ứng dụng của công ty bạn thay vì thử tất cả các lĩnh vực cùng một lúc.
Thông tin chính thức có thể được tìm thấy ở hai nơi:
- Bảng xếp hạng và tổng quan: https://livebench.ai/
- Mã và tập dữ liệu: https://github.com/LiveBench/LiveBench
Giá trị thực sự của việc điều hành trang của riêng bạn không nằm ở việc tái tạo thứ hạng của bạn. Ý tưởng là mang lại ý tưởng đo lường các vấn đề của công ty bạn bằng cách sử dụng cùng một khuôn khổ.
Làm cách nào tôi có thể sử dụng nó để chọn mô hình trong công ty của mình?
Việc sử dụng LiveBench để sàng lọc ban đầu là thực tế để thu hẹp ứng viên xuống còn khoảng ba, sau đó đưa ra quyết định cuối cùng thông qua một bài kiểm tra độc lập sử dụng dữ liệu của chính công ty bạn.
Viết ra các bước cụ thể.
Bước 1: Quyết định một trường hợp sử dụng Ngừng tìm kiếm “mô hình AI chung”. Thu hẹp nó thành "trích xuất số tiền và đối tác kinh doanh từ một bản PDF hóa đơn."
Bước 2: Thu hẹp xuống còn ba dựa trên điểm số của các hạng mục tương ứng. Đối với công việc trích xuất, cần phải phân tích dữ liệu và hướng dẫn sau. Mã hóa để tạo mã. Tôi không thấy thứ hạng tổng thể.
Bước 3: Kiểm tra 20-30 bài kiểm tra bằng dữ liệu thực của riêng bạn Đây là dữ liệu thật. Sử dụng dữ liệu thực tế trong quá khứ, đưa ra các hướng dẫn giống nhau cho tất cả các mô hình và so sánh kết quả. Sử dụng chính xác các hướng dẫn giống nhau cho tất cả các kiểu máy. Sai lầm phổ biến nhất là nhầm lẫn sự khác biệt về chất lượng hướng dẫn với sự khác biệt về hiệu suất.
Bước 4: Ghi lại không chỉ tỷ lệ hoàn thành mà còn cả số lần làm lại. Nếu đó là giá trị nhị phân của ``Tôi đã làm được/Tôi không thể làm được'' thì sẽ không có gì khác biệt. Tôi sẽ để lại một bản ghi về số lần nó được viết lại và mức độ can thiệp của con người.
Chúng tôi đã tạo một bảng gồm các danh mục cần được xem theo mục đích.
| Sử dụng nội bộ | Danh mục ưu tiên | Các chỉ số phụ trợ |
|---|---|---|
| Tạo/đánh giá mã | mã hóa | Đã xác minh băng ghế dự bị SWE |
| Khai thác thông tin từ tài liệu | Phân tích dữ liệu, tuân thủ hướng dẫn | Dễ dàng xử lý các văn bản dài |
| Điều tra/thu thập thông tin | lý luận, ngôn ngữ | Bạn có thể hiển thị nguồn không? |
| Tạo tài liệu tiêu chuẩn | Tuân thủ các hướng dẫn | tính tự nhiên của tiếng nhật |
| Tính toán/thiết kế logic phức tạp | toán học, lý luận | Kim cương GPQA |
Nói cách khác, LiveBench là công cụ giúp giảm số lượng ứng viên. Nó không phải là một công cụ quyết định.
Khi chọn mô hình cho mục đích nghiên cứu, có những tình huống trong đó mô hình dành riêng cho tìm kiếm sẽ phù hợp hơn mô hình trò chuyện có mục đích chung. Khả năng sử dụng của Felo, vốn rất mạnh trong nghiên cứu của Nhật Bản, được tóm tắt trong hướng dẫn đầy đủ của Felo. Có rất nhiều bản dùng thử, vì vậy rất đáng để đưa vào so sánh.
Khi nào bạn không nên tin tưởng LiveBench quá nhiều?
Chất lượng bài viết, tính tự nhiên của tiếng Nhật, hiệu quả chi phí và tốc độ phản hồi. Bốn thứ này không thể tìm thấy trong LiveBench.
Tôi sẽ xem chúng theo thứ tự.
Chất lượng bài viết Vì câu trả lời đúng không thể được xác định duy nhất nên nó không được đưa vào câu hỏi ngay từ đầu. Cách duy nhất để thấy được sức mạnh của một câu cửa miệng hoặc một đề xuất là hãy tận mắt nhìn thấy nó.
Sự tự nhiên của tiếng Nhật Vấn đề là tiếng Anh. Có một mô hình thực tế mà ngay cả khi bạn đạt điểm cao trong môn tiếng Anh, kính ngữ tiếng Nhật của bạn vẫn bị hỏng. Nếu bạn muốn sử dụng nó cho công việc bằng tiếng Nhật thì không có cách nào khác ngoài việc thử dùng nó bằng tiếng Nhật.
Giá cả/Hiệu quả Chúng tôi không đo lường chi phí cho mỗi câu hỏi. Nếu giá của một mẫu 93 điểm và một mẫu 89 điểm chênh nhau 10 lần thì 89 điểm là câu trả lời đúng cho hầu hết các công việc. Về cách nghĩ về phí, bạn cũng có thể tham khảo các bài viết liên quan về cách nghĩ về phí AI.
Tốc độ phản hồi Khi được tích hợp vào trò chuyện nội bộ, tốc độ nhận biết cũng hiệu quả như độ chính xác. Phép đo riêng biệt cũng được yêu cầu ở đây.
Ngoài ra, khả năng tạo hình ảnh và video hoàn toàn nằm ngoài phạm vi. Sẽ chẳng ích gì khi xem xét điểm chuẩn ngôn ngữ nếu bạn muốn biết khả năng tạo hình minh họa. Trong lĩnh vực đó, sẽ thực tế hơn khi so sánh các công cụ minh họa AI và so sánh ComfyUI và Stable Diffusion, những công cụ xử lý việc tạo ra trong môi trường cục bộ.
Nói cách khác, LiveBench là một thước đo cực kỳ hẹp và sâu, chỉ xem xét liệu bạn có thể đưa ra câu trả lời đúng về mặt logic hay không. Thu hẹp không phải là một nhược điểm. Vấn đề duy nhất là sử dụng nó mà không biết nó hẹp đến mức nào.
3 thói quen để tránh bị ảnh hưởng bởi số benchmark
Nếu bạn có thói quen kiểm tra ngày tháng, phạm vi câu hỏi và mục đích của mình trước khi nhìn vào bảng xếp hạng, bạn sẽ cải thiện được độ chính xác trong phán đoán của mình.
Thói quen 1: Xem ngày đầu tiên Người mẫu thay đổi vài tháng một lần. Thứ hạng từ các bài báo được viết sáu tháng trước hầu như không có giá trị như dữ liệu. Bảng xếp hạng không có ngày tham chiếu là nguyên nhân cần thận trọng.
Thói quen 2: Có thể nói những gì bạn đo được trong một dòng Trừ khi bạn có thể giải thích rằng ``SWE-bench là tỷ lệ sửa lỗi thực tế thành công'', sẽ an toàn hơn nếu không phát biểu tại các cuộc họp dựa trên con số đó.
Thói quen 3: Nếu chênh lệch trong phạm vi 3 điểm thì coi như nhau. Trong thực tế, mô hình 93 điểm và 91 điểm gần như không thể phân biệt được. Sẽ hợp lý hơn nếu chọn dựa trên giá cả và tốc độ thay vì chọn cái cao hơn dựa trên sự chênh lệch giữa hai điểm.
Chỉ cần làm theo ba điều này, cách bạn đọc các bài viết chuẩn sẽ thay đổi. Những con số không phải là sự khẳng định mà là những quan sát có điều kiện. Nếu bạn sử dụng nó mà không kiểm tra các điều kiện, mọi thứ sẽ không ổn.
Ban biên tập Phán quyết
LiveBench hiện là lựa chọn duy nhất để sàng lọc ban đầu cho việc lựa chọn mô hình. Các hoạt động liên tục thay thế các câu hỏi và hạn chế về việc không cho phép AI ghi điểm. Hầu như không có benchmark nào khác thực hiện được hai việc này cùng một lúc. Nó hữu ích vì bạn có thể tin tưởng vào những con số.
Tuy nhiên, thực sự không phải là một ý tưởng hay nếu sử dụng trực tiếp thứ hạng tổng thể trong quá trình ra quyết định nội bộ. Việc MiniMax M2.5 đứng thứ 27 trong LiveBench và thứ 4 trong SWE-bench Verify cho thấy rõ mức độ nguy hiểm của nó. Điểm tổng thể là một cấu trúc dựa trên toán học cạnh tranh và mã hóa agent, đồng thời không có mối tương quan với các nhiệm vụ như đọc hóa đơn hoặc định dạng biên bản.
Chỉ có một cách để sử dụng nó. Thu hẹp ứng viên xuống còn ba dựa trên điểm hạng mục, sau đó kiểm tra 20 ứng viên bằng cách sử dụng dữ liệu thực tế của công ty bạn để quyết định. Chỉ sau thời điểm này điểm chuẩn mới có lợi tức đầu tư. Các hoạt động kết thúc bằng cách nhìn vào bảng xếp hạng là một cách sử dụng thời gian không hiệu quả.
Nếu bạn chủ yếu làm việc bằng tiếng Nhật, sự khác biệt trong cách ứng xử bằng tiếng Nhật sẽ lớn hơn rất nhiều so với sự khác biệt về điểm số LiveBench. Bạn chỉ cần tự mình đo lường nó.
Các câu hỏi thường gặp (FAQ)
Hỏi. Tôi có thể sử dụng LiveBench miễn phí không?
Xem bảng xếp hạng là miễn phí. Mã đánh giá và tập dữ liệu cũng được cung cấp công khai nên bạn không mất phí khi tự chạy mã. Tuy nhiên, bạn sẽ chịu trách nhiệm thanh toán phí sử dụng API cho mô hình đang được đánh giá. Nếu bạn sử dụng model cao cấp cho tất cả các hạng mục thì sẽ tốn một khoản tiền khá lớn, vì vậy việc thu hẹp nó lại ở những khu vực gần với mục đích sử dụng của bạn là điều thực tế.
Q. Tại sao thứ hạng lại thay đổi tùy theo điểm chuẩn?
Điều này là do những gì đang được đo lường là khác nhau. LiveBench tập trung vào toán học cạnh tranh và mã hóa giống agent, còn SWE-bench Verify xem xét tỷ lệ thành công của các bản sửa lỗi trong thế giới thực. Ngay cả khi mô hình giống nhau, thứ hạng của nó sẽ thay đổi nếu đặc điểm của nó khác nhau. Trước khi so sánh thứ hạng, hãy kiểm tra xem mỗi thứ hạng đo lường điều gì.
Q. Có những tiêu chuẩn chưa được xác định nào khác không?
Có một số thiết kế khó ghi nhớ, chẳng hạn như ARC-AGI-2, đặt câu hỏi về lý luận mẫu trừu tượng. Tuy nhiên, chỉ có một số lượng hạn chế các trang web tiếp tục hoạt động nhờ “các câu hỏi thay đổi thường xuyên”. Điểm yếu chung của các điểm chuẩn là chúng bắt đầu bị ô nhiễm ngay khi chúng được xuất bản, do đó độ tin cậy của chúng giảm xuống khi chúng ngừng được cập nhật.
Q. Có an toàn khi chọn mô hình xếp hạng tổng thể đầu tiên không?
Bạn có thể phạm sai lầm. Tổng số điểm là tổng của nhiều hạng mục và có thể không nhất thiết phải phù hợp với mục đích của công việc. Nếu mục tiêu chính của bạn là trích xuất thông tin từ tài liệu, bạn nên xem xét điểm phân loại để phân tích dữ liệu và tuân thủ hướng dẫn. Xếp hạng tổng thể số 1 chỉ có nghĩa là "tốt ở mức trung bình" và không nhất thiết có nghĩa là bạn là người giỏi nhất trong công việc của mình.
Q. Tôi có thể kiểm tra hiệu suất tiếng Nhật bằng LiveBench không?
Tôi không hiểu. Các câu hỏi đều bằng tiếng Anh. Có rất nhiều trường hợp người mẫu đạt điểm cao môn tiếng Anh lại vi phạm kính ngữ trong tiếng Nhật. Nếu bạn muốn sử dụng nó cho doanh nghiệp Nhật Bản, bạn không có lựa chọn nào khác ngoài việc kiểm tra riêng nó với dữ liệu thực tế của Nhật Bản. Nếu bỏ qua bước này chắc chắn sau này bạn sẽ phải làm lại.
Q. Mô hình trọng lượng mở có phù hợp để sử dụng thực tế không?
Nó là đủ tùy thuộc vào mục đích. Tính đến tháng 7 năm 2026, MiniMax M2.5 đã đạt 80,2% trong bài kiểm tra băng ghế dự bị SWE đã được xác minh và khoảng cách trong lĩnh vực mã hóa đã được thu hẹp rõ ràng. Tuy nhiên, việc hỗ trợ ngôn ngữ tiếng Nhật, nỗ lực vận hành và tính dễ sử dụng trong công ty lại là những vấn đề khác. Đừng quyết định chỉ dựa trên hiệu suất; so sánh chi phí hoạt động là tốt.
Hỏi. Tôi cần tiến hành bao nhiêu cuộc kiểm tra nội bộ để đưa ra quyết định?
Đặt mục tiêu cho 20 đến 30 mục, với một mục đích duy nhất. Điều quan trọng hơn số lượng trường hợp là gửi chính xác các hướng dẫn giống nhau cho tất cả các kiểu máy. Nếu các hướng dẫn khác nhau thì sự khác biệt về chất lượng của các hướng dẫn có thể bị nhầm lẫn với sự khác biệt về hiệu suất. Nếu bạn cũng ghi lại "bạn viết lại nó bao nhiêu lần", bạn sẽ thấy sự khác biệt mà chỉ riêng tỷ lệ hoàn thành không thể thấy được.
Q. Sự khác biệt giữa điểm chuẩn là gì?
Sự khác biệt trong vòng 3 điểm gần như không thể nhận ra trong thực tế. Nếu bạn có thời gian lo lắng về 93 điểm và 91 điểm, sẽ tốt hơn nếu so sánh giá cả và tốc độ phản hồi. Nếu mở từ 10 điểm trở lên sẽ có sự khác biệt về khả năng sử dụng.
Xem các so sánh/lựa chọn thay thế liên quan
Khi chọn một mô hình, việc so sánh từng đối một có thể nhanh hơn bảng xếp hạng. Tôi sẽ liệt kê một so sánh để những người đã quyết định mục đích sử dụng của họ.
- ChatGPT vs Claude - Hai gã khổng lồ về trò chuyện có mục đích chung. Sự khác biệt giữa thói quen viết và xử lý câu dài
- Claude vs Gemini - Sự khác biệt giữa mã hóa và lý luận khoa học
- ChatGPT vs Gemini - So sánh tích hợp tìm kiếm và tích hợp công cụ kinh doanh
- Mã Claude vs Con trỏ - Bạn nên sử dụng cái nào thường xuyên trong quá trình phát triển?
- Con trỏ so với GitHub Copilot - Các cách sử dụng tích hợp trình chỉnh sửa khác nhau
- Felo vs Perplexity — Lựa chọn cho mục đích nghiên cứu
Nếu muốn tìm kiếm ứng viên theo danh mục, tốt nhất bạn nên duyệt qua danh sách công cụ mã hóa AI hoặc danh sách công cụ nghiên cứu AI. Nếu bạn đang tìm kiếm hỗ trợ triển khai tại một địa điểm phát triển, giá cả và môi trường được hỗ trợ sẽ được tóm tắt trên trang Mã Claude và Con trỏ.
Đọc cái này vào lần sau. Nếu công ty của bạn đã tiến tới giai đoạn kết hợp AI vào hoạt động thực tế, chúng tôi khuyên bạn nên sử dụng AI trong hoạt động kiểm toán nội bộ. Phương pháp tạo tiêu chí đánh giá và thiết kế hệ thống kiểm tra có thể được áp dụng trực tiếp vào khái niệm lựa chọn mô hình.
ChatGPT là chatbot AI hỗ trợ trả lời câu hỏi, tạo văn bản, sắp xếp thông tin và tạo ý tưởng thông qua đối thoại tự nhiên. Bạn có thể thực hiện các tác vụ dựa trên văn bản như tóm tắt văn bản dài, soạn thảo email và đề xuất, dịch, diễn giải và sắp xếp chúng dưới dạng bảng trong khi trò chuyện. Chúng tôi còn cung cấp dịch vụ tạo mã lập trình, xác nhận nguyên nhân lỗi, giải thích nội dung học tập và tư vấn bằng hình ảnh. Nó phù hợp cho những người dùng muốn sử dụng nó cho nhiều mục đích khác nhau, từ nghiên cứu cá nhân đến hỗ trợ tạo và phát triển tài liệu kinh doanh.
Trang web chính thức của từng công cụ (thông tin chính)
Giá cả, chức năng và phạm vi hỗ trợ là thông tin chính được cung cấp bởi trang web chính thức của mỗi công ty. Bài viết này dựa trên xác minh tại thời điểm xuất bản, nhưng hãy nhớ kiểm tra từng trang chính thức để biết các điều kiện chính xác và mới nhất.
- Claude — Trang web chính thức (xem chi tiết)
- ChatGPT — Trang web chính thức (xem chi tiết)
- Gemini — Trang web chính thức (xem chi tiết)
Gemini là trợ lý AI tương tác do Google cung cấp và là chatbot AI hỗ trợ trả lời câu hỏi, viết câu, tóm tắt và tạo ý tưởng dưới dạng trò chuyện. Nó có thể đọc nội dung không chỉ từ văn bản mà còn từ hình ảnh và tệp, đồng thời có thể được sử dụng để sắp xếp các điểm chính của tài liệu, văn bản email nháp, cách diễn đạt lại cụm từ, v.v. Nó cũng hỗ trợ các câu trả lời dựa trên thông tin tìm kiếm của Google và tích hợp với các dịch vụ của Google như Gmail, Google Docs và Google Drive. Đối với các cá nhân và nhóm thường làm việc hoặc học tập trong môi trường Google, ưu điểm là dễ dàng thực hiện từ nghiên cứu đến sáng tạo trong cùng một quy trình.