ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

SWE-bench Pro (bảng mã phiên bản khó)

SWE-bench Pro là một tiêu chuẩn đánh giá khả năng mã hóa ở quy mô thực tế khó hơn, được tạo ra sau khi SWE-bench cũ được xác minh không thể đo lường sự khác biệt về khả năng do bão hòa điểm số và ô nhiễm.

SWE-bench Pro là phiên bản khó của tiêu chuẩn về mã hóa AI do Scal AI phát hành vào năm 2026 và bao gồm 1.865 nhiệm vụ khắc phục sự cố được thu thập từ 41 dự án thực tế. Trong SWE-bench cũ đã được xác minh (500 mục), các mô hình chính đạt trên 70% trên toàn diện và người ta chỉ ra rằng có "sự bão hòa" và "ô nhiễm dữ liệu học tập". Pro được thiết kế để bao gồm một số kho lưu trữ thương mại tư nhân nhằm tăng khả năng chống ô nhiễm và yêu cầu sửa đổi quy mô lớn trải rộng trên nhiều tệp. Do đó, người ta nói rằng mô hình hàng đầu, đạt hơn 70% trong Đã xác minh, đã giảm xuống mức 20% trong Pro và sự khác biệt về độ khó khi chỉ số đã trở thành chủ đề nóng trong lĩnh vực này. Cạm bẫy về mặt chi phí trong hoạt động thực tế là chi phí thực hiện đánh giá loại agent cao hơn so với Đã xác minh vì các tác vụ được giả định là có ngữ cảnh dài và nhiều tệp. Khi chọn một mô hình trong lĩnh vực này, tiêu chuẩn kể từ năm 2026 không chỉ đánh giá dựa trên điểm số của Pro mà sử dụng nó làm so sánh tương đối cho một nhiệm vụ bằng ngôn ngữ và quy mô tương tự như cơ sở mã của công ty bạn.

Thuật ngữ liên quan