pass@k là chỉ số đánh giá cho biết xác suất để ít nhất một trong k mẫu mã được tạo bởi AI tạo mã vượt qua tất cả các bài kiểm tra đơn vị.
pass@k là chỉ số đánh giá điển hình để đo lường hiệu suất của AI tạo mã. Nó được định nghĩa là xác suất mà khi k mẫu mã được tạo ra, ít nhất một mẫu sẽ vượt qua tất cả các bài kiểm tra đơn vị. Khi k bằng 1 (pass@1), nó đại diện cho ``xác suất nhận được câu trả lời đúng trong một lần'' và khi k là 10 hoặc 100, nó đại diện cho ``xác suất đậu nếu bạn thử nhiều lần'', cho phép bạn đánh giá độ tin cậy của mô hình và tính đa dạng của thế hệ cùng một lúc.
Trong các hoạt động thực tế vào năm 2026, nhận thức rằng việc chỉ dựa vào pass@1 làm trục đánh giá đang được thiết lập trên thực địa là rất nguy hiểm. Các công cụ hoàn thành như GitHub Copilot và Cursor dựa trên tiền đề là người dùng sử dụng chúng trong khi từ chối nhiều đề xuất, do đó pass@5-10 gần với trải nghiệm thực tế hơn. Mặt khác, đối với các AI agent mã hóa hoàn toàn tự động, độ tin cậy của pass@1 là yếu tố quyết định.
Về mặt chi phí, việc đo pass@k yêu cầu chi phí suy luận bằng k lần số vấn đề. Nếu bạn bật k=100 trên HumanEval (164 câu hỏi), ngay cả một mô hình tương đương với GPT-4 cũng sẽ có giá hàng chục nghìn yên Nhật, vì vậy giá trị thị trường mà ReviewAI hiểu là ``k=5 cho lựa chọn quy mô nhỏ, k=20 cho điểm chuẩn chính xác'' là một thủ thuật trong lĩnh vực này. Các tiêu chuẩn khó như MBPP và HumanEval+ cũng đã trở nên phổ biến và quy trình đánh giá tiêu chuẩn vào năm 2026 sẽ không chỉ xem xét giá trị pass@k đơn giản mà còn xem xét phân tích lỗi.