ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

MBPP (Băng ghế tạo mã Python)

MBPP là điểm chuẩn đánh giá nhằm đo lường độ chính xác khi tạo mã của các mô hình AI ở định dạng pass@k bằng cách sử dụng bộ bài toán lập trình Python dành cho người mới bắt đầu.

MBPP là viết tắt của ``Các vấn đề Python cơ bản nhất'' và được biết đến như một điểm chuẩn đánh giá bao gồm khoảng 1.000 tác vụ Python ngắn (chẳng hạn như triển khai hàm và các vấn đề thuật toán) có thể được giải quyết bởi các lập trình viên mới bắt đầu. Cùng với HumanEval, đây là một trong những chỉ số tiêu chuẩn ngành để đo lường khả năng tạo mã của LLM và được đánh giá dựa trên tỷ lệ phần trăm câu trả lời đúng như pass@1 và pass@k. Tuy nhiên, trong thực tế vận hành tính đến năm 2026, người ta đã chỉ ra rằng các vấn đề của MBPP là quá cơ bản nên điểm số của các mô hình quy mô lớn mới nhất sẽ giữ ở mức cao trên toàn diện, khiến khó có thể phân biệt được giữa chúng. Khi chọn một mô hình tại hiện trường, việc sử dụng không chỉ giá trị số MBPP mà còn cả đánh giá (chẳng hạn như băng ghế dự bị SWE) được coi là thực tế, bao gồm các nhiệm vụ liên quan đến chỉnh sửa nhiều tệp phức tạp và sử dụng thư viện được xử lý trong thực tế. Người ta cũng đã chỉ ra rằng một số dữ liệu đánh giá có thể được trộn lẫn vào dữ liệu đào tạo (ô nhiễm dữ liệu), vì vậy điều quan trọng là không lấy điểm theo mệnh giá mà đưa ra quyết định dựa trên sự cân bằng giữa chi phí và độ chính xác gần với trường hợp sử dụng của riêng bạn.

Thuật ngữ liên quan