SWE-Lancer là chuẩn mực đo lường khả năng phát triển phần mềm của các mô hình AI về mặt giá trị kinh tế, dựa trên các dự án freelance thực tế và số tiền thù lao thực tế.
SWE-Lancer là điểm chuẩn đánh giá mã hóa được xây dựng bằng cách kết hợp các dự án làm việc tự do thực tế (chủ yếu là các nhiệm vụ liên quan đến kho lưu trữ Expensify trên Upwork) và mức thù lao thực tế được đặt cho từng dự án. Trong khi các điểm chuẩn mã hóa thông thường chỉ đo lường tỷ lệ chính xác, SWE-Lancer độc đáo ở chỗ nó liên kết giá trị kinh tế tính bằng đô la với các nhiệm vụ riêng lẻ và cho thấy AI có thể làm được bao nhiêu công việc trong thực tế. Các mục tiêu đánh giá được chia thành hai loại: nhiệm vụ triển khai mã (IC SWE) và nhiệm vụ quản lý thực hiện việc ra quyết định và đánh giá kỹ thuật, đồng thời việc đạt/không đạt được xác định thông qua thử nghiệm thực tế từ đầu đến cuối. Trong hoạt động thực tế kể từ năm 2026, ngay cả các mô hình cao cấp cũng được cho là có thể thu được ít hơn một nửa giá trị kinh tế của toàn bộ nhiệm vụ và xu hướng tỷ lệ trả lời đúng giảm đối với các nhiệm vụ đắt tiền hơn so với tỷ lệ trả lời đúng đơn giản đang thu hút sự chú ý như một yếu tố lựa chọn trong lĩnh vực này. Bí quyết để tránh những cạm bẫy thực tế là không đánh giá hiệu suất chi phí vận hành thực tế của một mô hình chỉ dựa trên điểm chuẩn mà phải kiểm tra giá trị thị trường cho một tập hợp con các xu hướng nhiệm vụ của công ty bạn trước khi quyết định có áp dụng nó hay không.