SWE-bench là điểm chuẩn tiêu chuẩn ngành để đánh giá AI mã hóa nhằm đo lường xem liệu AI có thể tự động khắc phục các sự cố thực tế trên GitHub hay không.
SWE-bench là bộ đánh giá khả năng mã hóa nguồn mở do Đại học Princeton phát hành vào năm 2023. Nó chứa 2.294 vấn đề GitHub chính hãng và các bản vá tương ứng được thu thập từ các kho lưu trữ Python mã nguồn mở chính (Django, scikit-learn, v.v.) và được tính điểm dựa trên việc liệu AI có thể tự động tạo các bản vá vượt qua bộ thử nghiệm hay không. Phiên bản ``Đã xác minh'' được lựa chọn cẩn thận (500 mục) được sử dụng rộng rãi để so sánh mô hình tại hiện trường.
Theo ReviewAI, tính đến năm 2026, Claude Opus 4 đứng ở vị trí cao nhất với số điểm được xác minh là khoảng 72% và các mô hình mã hóa chuyên dụng có xu hướng hoạt động tốt hơn các mô hình có mục đích chung từ 10 đến 20 điểm.
Có ba cạm bẫy trong hoạt động thực tế. ① Giải thích điểm: Có sự chênh lệch hơn 15% giữa Phiên bản đầy đủ và Đã xác minh, vì vậy hãy nhớ kiểm tra xem cái nào là giá trị được công bố. ②Chi phí: Tương đương với GPT-4o, giá trung bình là 0,5 đến 2 USD cho mỗi nhiệm vụ và 500 đến 2.000 USD để đánh giá đầy đủ. ③ Tập trung quá nhiều vào Python: Đừng quá tự tin vào việc ngoại suy điểm số trực tiếp cho các dự án TypeScript/Go. Chúng tôi khuyên bạn nên sử dụng nó kết hợp với các phép đo thực tế bằng cơ sở mã của riêng bạn.