SWE-bench Verify là chỉ số đánh giá mã hóa nhằm đo lường mức độ AI có thể giải quyết các vấn đề sửa lỗi trong kho GitHub thực bằng cách sử dụng 500 tác vụ được lựa chọn cẩn thận và được xem xét kỹ lưỡng theo cách thủ công.
SWE-bench Verify là một điểm chuẩn tiêu chuẩn ngành để đánh giá các AI agent mã hóa, bao gồm 500 kết quả mà OpenAI đã xem xét kỹ lưỡng theo cách thủ công tập dữ liệu SWE-bench ban đầu vào năm 2024 và loại bỏ các nhiệm vụ không thể giải quyết được hoặc các nhiệm vụ có thông số kỹ thuật không rõ ràng. Một phương pháp được sử dụng rộng rãi là AI agent tạo ra các bản vá cho các vấn đề trong kho GitHub thực và chấm điểm chúng dựa trên việc chúng có vượt qua bộ kiểm tra tương ứng hay không. Trong hoạt động thực tế kể từ năm 2026, điều đáng lo ngại là điểm cao sẽ không trực tiếp dẫn đến cải thiện năng suất tại chỗ. Điểm chuẩn thiên về các kho lưu trữ Python và người ta chỉ ra rằng rất khó để đạt được độ chính xác tương tự với ngôn ngữ độc quyền của công ty hoặc cơ sở mã kế thừa lớn. Ngoài ra, điểm bạn hướng tới càng cao thì bạn càng phải thực hiện nhiều lần thử và gọi công cụ hơn, điều này có xu hướng làm tăng chi phí sử dụng API. Khi lựa chọn các mô hình và agent tại hiện trường, việc so sánh thời gian thực hiện và chi phí cho các nhiệm vụ tương tự như trong kho của công ty ngày càng trở nên phổ biến, thay vì chỉ so sánh điểm số.