Điểm chuẩn thành thạo mã hóa Python từ OpenAI. 164 nhiệm vụ thực hiện chức năng.
HumanEval là một điểm chuẩn về khả năng mã hóa Python do OpenAI phát hành vào năm 2021, tạo mã từ chuỗi tài liệu hàm gồm 164 câu hỏi và đánh giá xem liệu nó có vượt qua bài kiểm tra đơn vị hay không. Tính đến năm 2026, các LLM hàng đầu đạt trên 90% (Claude Opus 4.7 / GPT-5 là khoảng 95%) và có xu hướng bão hòa. Những phiên bản kế nhiệm của nó là SWE-bench (giải quyết vấn đề GitHub thực tế), LiveCodeBench (ngăn chặn rò rỉ + cập nhật hàng tháng) và BigCodeBench (nhiều ngôn ngữ). Có một sự hiểu biết chung trong lĩnh vực này là trong các hoạt động thực tế, việc đo lường độ chính xác của mã thực tế của công ty sẽ mang tính biểu thị hơn là điểm HumanEval.