ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

LiveCodeBench (Bộ mã chuẩn về khả năng chịu ô nhiễm)

LiveCodeBench là một điểm chuẩn liên tục thu thập các vấn đề mới từ các trang lập trình cạnh tranh như LeetCode và đánh giá khách quan khả năng mã hóa LLM trong các điều kiện loại trừ ô nhiễm dữ liệu học tập.

LiveCodeBench là khung đánh giá LLM mã được một nhóm nghiên cứu bao gồm MIT công bố vào năm 2024. Các điểm chuẩn thông thường như HumanEval và MBPP có các vấn đề đã được khắc phục, có khả năng cao được đưa vào dữ liệu đào tạo của mô hình (ô nhiễm) và nhược điểm là điểm số có xu hướng đánh giá quá cao khả năng của một người. LiveCodeBench liên tục thu thập các câu hỏi mới từ LeetCode, AtCoder và CodeForces, đồng thời loại bỏ cơ bản nguy cơ lây nhiễm bằng cách chỉ đánh giá các câu hỏi được xuất bản sau ngày kết thúc mô hình. Trong hoạt động thực tế kể từ năm 2026, nó đã được thiết lập làm chỉ số đánh giá mã hóa cho các mẫu máy lớn như Claude 3.7 Sonnet và Gemini 2.5 Pro, và xu hướng `` nhấn mạnh điểm LiveCodeBench hơn điểm HumanEval '' đang tăng tốc khi chọn nó trong hiện trường. Điều đáng tiếc là việc phân bổ độ khó nghiêng về LeetCode và tập trung vào các vấn đề thuật toán dành riêng cho lập trình cạnh tranh; thật dễ dàng bỏ qua thực tế là nó khác với việc tạo mã doanh nghiệp (tạo trình bao bọc API, mã kiểm tra, v.v.). Xét về giá trị thị trường, việc chạy một bộ API đầy đủ tương đương với GPT-4o có thể tiêu tốn hàng chục nghìn yên Nhật và không thể bỏ qua chi phí đánh giá. Bài viết so sánh AI mã hóa ReviewAI sử dụng LiveCodeBench từ góc độ khả năng chống ô nhiễm để đảm bảo độ tin cậy của điểm số.

Thuật ngữ liên quan