Điểm chính của bài viết này pass@k là một chỉ số thể hiện xác suất nếu bạn để AI viết k lần thì nó sẽ đưa ra một mã hoạt động ít nhất một lần. Đối với k=1 và k=100, các con số thay đổi gần gấp 3 lần ngay cả đối với cùng một mô hình, do đó, chỉ so sánh điểm mà không nhìn vào k sẽ dẫn đến nhận định sai. Nếu bạn muốn giao phó việc tự động hóa cho doanh nghiệp của mình, thì một pass^k luôn đòi hỏi thành công sẽ gần với thực tế hơn một pass@k luôn mong đợi thành công. Khi đọc điểm được công bố, bạn có thể dễ dàng phát hiện các điểm phóng đại bằng cách chỉ cần kiểm tra ba điểm: "k", "cỡ mẫu n" và "mức độ nghiêm trọng của bài kiểm tra".
Hộp thông tin Ban biên tập
Chỉ số tỷ lệ thành công dựa trên xác suất (0 đến 1 hoặc được biểu thị bằng %)
Các tác vụ có thể được xác định là chính xác bằng cách sử dụng AI tạo mã/thử nghiệm tự động
Bản thân chỉ mục này là miễn phí. Chỉ phát sinh chi phí thực hiện suy luận
Ngôn ngữ độc lập. Công thức tương tự có thể được sử dụng để đo hướng dẫn bằng tiếng Nhật.
Có thể được đo lường thông qua API suy luận của mỗi công ty (trả tiền khi bạn sử dụng)
Khi sử dụng mã nội bộ để đánh giá, hãy cẩn thận về phạm vi truyền tải tới các API bên ngoài.
Xác nhận lần cuối: Ngày 28 tháng 7 năm 2026 bởi ban biên tập
Con số ``XX% with pass@1'' được xếp hàng trong tài liệu thuyết trình của mô hình. Nó trông thật tuyệt vời, nhưng tôi chắc chắn rằng có nhiều người nhìn vào nó mà không thực sự hiểu con số đằng sau @ có nghĩa là gì.
Tôi sẽ đặt câu trả lời đầu tiên. Chữ “k” trong pass@k là số lần AI được thử thách. Khi bạn hiểu điều này, cách bạn đọc điểm được công bố sẽ thay đổi ngay lập tức.
pass@k là một chỉ báo được coi là thành công nếu nó đúng dù chỉ một lần trong k lần.
pass@k là xác suất khi AI tạo sinh k câu trả lời cho một nhiệm vụ nhất định thì ít nhất một trong số chúng sẽ đúng. Trong trường hợp tạo mã, việc tạo mã được coi là thành công nếu ngay cả một trong k mã được tạo vượt qua tất cả các thử nghiệm đã chuẩn bị.
Vấn đề là "dù chỉ một". Cho dù 9 trên 10 là rác, nhưng nếu có 1 cái làm được thì nhiệm vụ sẽ được coi là thành công.
Phương pháp đếm này gần với quy trình thực tế mà con người sử dụng AI. Hãy để họ đưa ra một số ứng cử viên và chọn một ứng viên phù hợp. Đây là cách nhiều nhà phát triển sử dụng nó. Ngược lại, nó cũng là dấu hiệu cho thấy ai đó sẽ trả tiền cho công sức tuyển chọn ứng viên.
Các phán đoán không được con người đưa ra một cách chủ quan mà tự động bằng mã kiểm tra được viết sẵn. Do đó, nó có khả năng tái sản xuất cao và dễ sử dụng để so sánh. Đây là thế mạnh mà các chỉ số đánh giá khác không có.
Tại sao một tỷ lệ trả lời đúng là không đủ?
Đầu ra AI thay đổi mỗi lần. Ngay cả khi bạn đưa ra những hướng dẫn tương tự (hướng dẫn cho AI, còn gọi là lời nhắc), nó thường sẽ hoạt động ở lần đầu tiên chứ không phải lần thứ hai.
Vì vậy, chỉ cần nói “Tôi đã thử một lần và thành công/sai”, tôi không thể biết đó là do khả năng của người mẫu hay chỉ là sự trùng hợp ngẫu nhiên.
| Cách đo | bạn biết gì không? | Điểm yếu |
|---|---|---|
| chỉ thử một lần | đánh hoặc trượt | Quá nhiều yếu tố may mắn |
| Tỷ lệ trả lời đúng trung bình | Chất lượng trung bình của sản lượng tổng thể | Không phù hợp với cách sử dụng "chọn từ ứng viên" |
| vượt qua@k | Xác suất tìm được câu trả lời đúng trong k lần | Không thể so sánh trừ khi k được căn chỉnh. |
| vượt qua^k | Xác suất thành công tất cả k lần | Nó trông không đẹp vì số lượng có vẻ thấp. |
Nói cách khác, pass@k là một chỉ báo kết hợp ``tiền đề rằng bạn có thể thử nó nhiều lần'' vào công thức của nó.
Điều quan trọng cần ghi nhớ ở đây là tính chất tăng k sẽ luôn làm tăng điểm. Đó là lý do tại sao cần biết công thức sau.
Tôi cũng muốn đọc nó
3 cách chạy trình bảo vệ màn hình DVD miễn phí và các bước tạo trình bảo vệ màn hình DVD của riêng bạn bằng AI
Chúng tôi đã tóm tắt các bước để làm cho biểu tượng DVD hiển thị xung quanh màn hình bằng ba cách: trình duyệt, phần mềm phân phối miễn phí và tự chế. Chúng tôi đã đề cập đến mọi thứ bạn có thể làm mà không do dự, bao gồm cả vị trí đặt nó trên Windows 11 và macOS, cách xác định các tệp .scr đi lạc, cách xảy ra các lần chạm góc và quy trình tạo phiên bản 50 dòng của riêng bạn bằng công cụ mã hóa AI.
Ngày 6 tháng 8 năm 2026
7 lựa chọn thay thế cho MAI-Cyber-1-Flash — Chọn từ miễn phí, tiếng Nhật và nguồn mở (phiên bản 2026)
MAI-Cyber-1-Flash bên trong MDASH là quyền truy cập đã được Azure AI Foundry kiểm duyệt. Đối với các nhóm phát triển không thể sử dụng ngay, chúng tôi đã tổ chức 7 ứng cử viên thay thế theo mức độ sử dụng, từ hệ thống nguồn mở miễn phí đến các dịch vụ thương mại có thể vận hành bằng tiếng Nhật.
Ngày 6 tháng 8 năm 2026
Công thức tính pass@k là gì?
Nếu bạn nghĩ một cách ngây thơ thì nó sẽ là 1 - (1 - p)^k, trong đó p là tỷ lệ trả lời đúng cho mỗi câu hỏi. Biểu mẫu thu được bằng cách trừ "xác suất loại bỏ tất cả" khỏi 1.
Tuy nhiên, trong đánh giá thực tế, chúng ta không sử dụng biểu thức này như nguyên trạng. Tiêu chuẩn là tạo ra n câu trả lời cho mỗi câu hỏi và khi c câu trả lời đúng, hãy sử dụng công thức ước tính không thiên vị bằng cách sử dụng các tổ hợp.
pass@k = 1 - C(n - c, k) / C(n, k)Hãy sắp xếp ý nghĩa của các ký hiệu.
| biểu tượng | nghĩa | Ví dụ về giá trị thực tế |
|---|---|---|
| N | Tổng số câu trả lời được tạo cho mỗi câu hỏi | 100, 200 |
| c | Số câu trả lời đúng | 34 |
| k | Cài đặt "Bạn có thể thử bao nhiêu lần?" | 1, 5, 10, 100 |
| C(a,b) | Số cách kết hợp để chọn b từ a | tổ hợp toán trung học |
Lý do sử dụng công thức này rất đơn giản: nếu bạn chỉ tính toán từ một số lượng nhỏ mẫu, các con số đó có thể bị định giá quá cao. Sự kết hợp này sẽ điều chỉnh độ lệch trong đó nếu chỉ một câu hỏi đúng khi n=k thì kết quả sẽ là 100%.
Bảng có một điểm chính. Bí mật đằng sau số điểm được công bố là hơn 100 mã thường được tạo cho mỗi câu hỏi.
Các số thay đổi như thế nào khi k=1, k=10 và k=100?
Đây là phần thú vị nhất. Ngay cả khi khả năng là như nhau (tỷ lệ chính xác p cho mỗi lần thử), chỉ cần thay đổi k sẽ thay đổi đáng kể diện mạo của nó.
| Tỷ lệ trả lời đúng mỗi lần p | vượt qua@1 | vượt qua@5 | vượt qua@10 | vượt qua@100 |
|---|---|---|---|---|
| 10% | 10% | Khoảng 41% | Khoảng 65% | Khoảng 99,997% |
| 30% | 30% | Khoảng 83% | Khoảng 97% | Gần như 100% |
| 50% | 50% | Khoảng 97% | Khoảng 99,9% | Gần như 100% |
Nói cách khác, ngay cả một mô hình có khả năng 30% cũng có thể nói là "gần như có thể giải quyết được vấn đề" nếu bị ném 100 lần. Đó là sự kỳ diệu của những con số.
Hãy coi pass@1 là dòng thực tế. Trong một quy trình tự động, nơi không có chỗ cho con người sàng lọc ứng viên, chất lượng của lần quay đầu tiên sẽ là kết quả. Mặt khác, nếu bạn ngồi viết mã và chọn liên tiếp từ năm ứng viên thì pass@5 sẽ gần với thực tế hơn.
Có một biến số ẩn khác quyết định điểm số của bạn. Đây là nhiệt độ quyết định tính ngẫu nhiên của thế hệ. Việc giảm nhiệt độ sẽ ổn định đầu ra và giúp tăng pass@1 dễ dàng hơn, đồng thời tăng nhiệt độ sẽ mở rộng phạm vi câu trả lời và có lợi khi k lớn. Chính vì đặc tính này mà người bán hàng điều chỉnh và đo nhiệt độ mỗi k.
Ngay cả khi model giống nhau, các con số sẽ thay đổi tùy theo cài đặt. Vì vậy, thật đáng để đọc ghi chú nhỏ bên cạnh bản nhạc.
Những gì pass@k có thể và không thể đo lường
Hãy rõ ràng về điểm mạnh và điểm yếu của bạn.
| quan điểm | Có thể đo bằng pass@k | không thể đo lường |
|---|---|---|
| nó có di chuyển hay không | ○ Nếu bài kiểm tra đạt, bạn đã đúng. | — |
| Khả năng đọc mã | — | × Khả năng bảo trì không được đánh giá |
| bảo vệ | — | × Kiểm thử thành công ngay cả với mã yếu |
| tốc độ thực hiện | — | × Đạt ngay cả khi số lượng phép tính kém nhất |
| hoàn thành một nhiệm vụ dài | △ Có thể hoàn thành một câu hỏi. | × Không giỏi sửa đổi nhiều tập tin |
Nói tóm lại, pass@k là một chỉ báo chỉ xem nó có hoạt động hay không. Chất lượng cần được đo lường riêng biệt.
Khi xây dựng các tiêu chuẩn đánh giá nội bộ, mấu chốt của việc thiết kế là làm thế nào để điền vào phía bên phải của bảng này. Nếu bạn đang xử lý đầu ra AI từ góc độ kiểm toán hoặc kiểm soát nội bộ, bạn sẽ dễ dàng quyết định mức độ chi tiết của các hạng mục đánh giá hơn nếu trước tiên bạn hiểu khái niệm kết hợp AI vào hoạt động kiểm tra nội bộ.
Sự khác biệt giữa pass^k là gì?
Phát âm là “Pass Hat Ke”. Trong khi pass@k có nghĩa là "thành công dù chỉ một lần trong k lần", pass^k là xác suất thành công tất cả k lần. Vì nó được biểu thị dưới dạng tích nên nó có dạng tương tự như p^k.
Sự khác biệt này phát huy tác dụng khi đánh giá các AI agent (một hệ thống trong đó AI xác định các bước và tiến hành công việc mà không cần con người kiểm tra từng bước).
| Cách sử dụng | chỉ số phù hợp | lý do |
|---|---|---|
| người ta chọn một ứng cử viên | vượt qua@k | Nếu một cây gậy chạm vào, công việc sẽ tiếp tục. |
| chạy tự động | vượt qua^k | Thất bại dù chỉ một lần sẽ dẫn đến tai nạn. |
| gửi trực tiếp cho khách hàng | vượt qua^k | Số lần thất bại được phép gần bằng không. |
Bạn có thể thấy tác động bằng cách nhìn vào các con số. Ngay cả khi một đặc vụ có tỷ lệ thành công mỗi lần là 90% thì xác suất hoàn thành 10 bước liên tiếp là khoảng 35%. Dù là 95% nhưng nếu có 20 quy trình thì sẽ vào khoảng 36%.
Tóm tắt cho đến nay: pass@k có nghĩa là "Tôi có trúng số không?" và pass^k có nghĩa là "Tôi sẽ thắng tất cả chứ?" Nếu thao tác được giám sát bởi một người, hãy sử dụng pass@k và nếu thao tác được giao cho người khác, hãy sử dụng pass^k. Chỉ cần sử dụng đúng cách, bạn có thể đánh giá mức độ hiệu quả của các con số trong tài liệu của nhà cung cấp trong thực tế.
Càng nhiều người thiết kế tự động hóa thì họ càng nên yêu cầu các số ở phía pass^k. Mặc dù trông tệ hơn nhưng nó gần với một thiết kế ít gây ra tai nạn hơn.
Nếu cỡ mẫu n nhỏ thì số liệu không thể tin cậy được.
pass@k là ước tính xác suất. Vì đây là ước tính nên sẽ không chính xác nếu mẫu nhỏ.
Pass@10, được tính khi chỉ tạo ra 10 câu hỏi cho mỗi câu hỏi, về cơ bản chỉ là xem liệu bạn có nhận được 1 trong số 10 câu hỏi hay không. Quá yếu để gọi đây là "khả năng".
Trong những năm gần đây, phương pháp nói về một điểm duy nhất này được coi là có vấn đề và một số người đã đề xuất rằng nó nên được báo cáo dưới dạng phạm vi xác suất (khoảng tin cậy). Lập luận là việc hiển thị phạm vi từ 70% đến 78% sẽ trung thực hơn so với một con số duy nhất.
Khi sử dụng nó trong thực tế, hãy nghĩ về nó theo cách này.
- Đối với những bài benchmark tự làm dưới 100 câu, nếu chênh lệch khoảng 5 điểm thì nằm trong khoảng sai số.
- Số lượng câu hỏi tạo ra cho mỗi câu hỏi ít nhất là 20, tốt nhất là 50 câu trở lên.
- Nếu bạn muốn yêu cầu chênh lệch, hãy đo hai lần vào những ngày khác nhau trong cùng điều kiện.
Cách rẻ nhất để cải thiện độ chính xác bằng số không phải là thay đổi mô hình mà là tăng số lượng câu hỏi.
Cạm bẫy ở khía cạnh đo điểm chuẩn: Lỗ kiểm tra và ô nhiễm dữ liệu
Điểm yếu của pass@k nằm ở chất lượng của bài kiểm tra được sử dụng để đánh giá hơn là bản thân thước đo.
Nếu bài kiểm tra của bạn lỏng lẻo, mã sai sẽ vượt qua. Các thử nghiệm không kiểm tra các giá trị biên hoặc viết các trường hợp đưa ra ngoại lệ. Những "câu trả lời sai đúng" lọt qua các lỗ này sẽ nâng cao điểm số của bạn.
Một vấn đề nghiêm trọng khác là ô nhiễm dữ liệu đào tạo. Có một số lượng lớn các câu hỏi và câu trả lời cho các điểm chuẩn nổi tiếng có sẵn trên internet và không thể loại trừ khả năng chúng được đưa vào quá trình đào tạo mô hình. Ngay cả khi bạn giải được một bài toán mà bạn biết câu trả lời thì điều đó cũng không chứng tỏ được khả năng của bạn.
HumanEval, một tiêu chuẩn công cộng mang tính đại diện, bao gồm 164 câu hỏi tạo chức năng, nhưng nguy cơ ô nhiễm tăng lên theo thời gian kể từ khi xuất bản. Các định nghĩa và bộ vấn đề có thể được tìm thấy trong kho OpenAI chính thức.
Có ba biện pháp.
- Tạo ra vấn đề từ các nhiệm vụ thực tế trong công ty (không gây ô nhiễm vì chúng không đến từ bên ngoài)
- Viết bài kiểm tra một cách nghiêm ngặt (đảm bảo bao gồm những điểm bất thường)
- Sử dụng nó kết hợp với băng ghế công cộng; không đưa ra quyết định chỉ dựa trên băng ghế công cộng.
Những con số bên ngoài là kim chỉ nam, còn những con số của chúng tôi là những con số thực tế. Đừng phá vỡ trật tự này.
5 bước để đo pass@k bằng chính nhiệm vụ của bạn
Chúng tôi có tất cả các công cụ. Đây là những gì xảy ra khi bạn làm theo các bước.
- Thu thập 50 câu hỏi — Độ chính xác sẽ tăng lên nếu bạn tạo chúng từ các yêu cầu hoặc chức năng trước đây mà bạn thực sự đã viết.
- Viết bài kiểm tra đạt/không đạt - không phải một bài kiểm tra bình thường mà là ba bài kiểm tra trở lên bao gồm cả bài kiểm tra bất thường
- Tạo n=20 trở lên cho mỗi câu hỏi - Nhiệt độ được cố định theo mục đích và được ghi lại.
- Đếm c (số câu trả lời đúng) và nhập nó vào công thức - hiển thị cả pass@1 và pass@5
- Đo các mô hình khác nhau với cùng một bộ vấn đề - đặt chúng cạnh nhau mà không thay đổi điều kiện
Số giờ công ước tính là 2 đến 3 ngày để chuẩn bị và vài giờ để thực hiện 50 câu hỏi. Sau khi được tạo, nó sẽ trở thành tài sản có thể được sử dụng lại mỗi khi tạo mô hình mới.
Khi lựa chọn một công cụ hỗ trợ mã hóa, tốt nhất bạn nên thu hẹp các ứng viên trong danh mục mã hóa AI và sau đó sử dụng quy trình này cho các nhiệm vụ của công ty bạn. Các loại tích hợp IDE như GitHub Copilot và Cursor có xu hướng đầu ra khác với các API suy luận thô, vì vậy mẹo ở đây là đo lường các tuyến đường được sử dụng thực sự.
GitHub Copilot là trợ lý mã hóa AI giúp các nhà phát triển viết mã trong trình soạn thảo và trên GitHub. Chúng tôi hỗ trợ hoàn thiện mã theo ngữ cảnh bạn đang nhập, tư vấn triển khai qua trò chuyện cũng như giải thích về mã hiện có và đề xuất sửa đổi. Nó cũng có thể được sử dụng với CLI và các IDE tương thích, cho phép bạn thực thi các lệnh và lập kế hoạch thay đổi tệp bằng ngôn ngữ tự nhiên. Nó phù hợp với những người dùng coi trọng tốc độ triển khai và cải thiện chất lượng trước khi xem xét, từ các nhà phát triển cá nhân viết mã hàng ngày cho đến các nhóm.
Danh sách kiểm tra khi đọc pass@k đã xuất bản
Khi bạn nhận được một tài liệu, chỉ cần kiểm tra năm dòng này và bạn sẽ không mắc sai lầm lớn.
| Kiểm tra các mục | Điểm để xem | tín hiệu nguy hiểm |
|---|---|---|
| giá trị của k | Số sau @ | Không có ký hiệu k |
| Số lượng mẫu n | Số lượng được tạo cho mỗi câu hỏi | Không được liệt kê hoặc ít hơn 10 |
| đặt vấn đề | Ghế công cộng hay ghế trong nhà? | Nội dung của nó không được tiết lộ trên băng ghế riêng của nó. |
| Cài đặt nhiệt độ | Tính ngẫu nhiên của thế hệ | Các điều kiện khác nhau đối với mỗi k |
| sự nghiêm ngặt của bài kiểm tra | Nó có bao gồm các hệ thống bất thường không? | Chỉ hệ thống bình thường |
Nếu hai hoặc nhiều con số này trống, bạn có thể coi những con số này như vật trang trí cho tài liệu bán hàng.
Sau khi bạn học cách đọc các con số, cuộc trò chuyện khi chọn mô hình sẽ thay đổi từ "nó có vẻ thông minh" sang "bao nhiêu phần trăm trong những điều kiện nào?"
Ý tưởng về pass@k có thể được sử dụng cho những thứ khác ngoài mã không?
Bạn có thể sử dụng nó. Bất kỳ lĩnh vực nào mà câu trả lời đúng có thể được xác định một cách máy móc đều có thể được áp dụng.
Tạo hình ảnh rất dễ hiểu. Rất hiếm khi có thể sử dụng một thẻ và trên thực tế, hãy chọn một thẻ có thể sử dụng nhiều lần. Đây chính xác là thế giới quan của pass@k. Nếu bạn đánh 10 lá bài và sử dụng 1 lá bài thì cũng giống như vượt qua@10 và tính là thành công.
Cảm giác về tỷ lệ chấp nhận này khá hữu ích như một tiêu chí để lựa chọn công cụ. Nhân đơn giá cho số tờ được sản xuất theo tỷ lệ áp dụng sẽ cho bạn chi phí thực tế của một tờ. Nếu bạn đang tìm kiếm ứng viên cho mục đích minh họa, trước tiên hãy đọc cách chọn công cụ minh họa AI theo mục đích sẽ giúp bạn hiểu rõ cách tính toán này được áp dụng. Nếu bạn đang cân nhắc việc chạy một lượng lớn dữ liệu trong môi trường cục bộ và sắp xếp nó, thì sự khác biệt giữa ComfyUI và Stable Diffusion sẽ hữu ích cho quyết định của bạn.
Các ứng dụng nghiên cứu phức tạp hơn một chút. Việc đánh giá bằng máy rất khó vì không có câu trả lời duy nhất. Tuy nhiên, bạn có thể tự động kiểm tra xem URL nguồn có tồn tại hay không hoặc trang nguồn có chứa mô tả tương ứng hay không. Ý tưởng đánh giá các tìm kiếm AI sử dụng tiêu chuẩn này tương thích với các công cụ hiển thị trích dẫn, chẳng hạn như tóm tắt cách sử dụng của Felo.
Điều tương tự cũng xảy ra với trợ lý đàm thoại nói chung và dịch vụ càng linh hoạt, giống như các chức năng và cách sử dụng của Meta AI, thì bạn càng có thể đo lường pass@1 trong công việc của mình để không mắc sai lầm khi đặt ra kỳ vọng.
Chỉ cần bạn có thể tạo ra một tiêu chuẩn đánh giá, bạn có thể áp dụng tiêu chuẩn tương tự cho bất kỳ AI nào. Đó chính là khả năng ứng dụng của chỉ số này.
Ban biên tập Phán quyết
pass@k vẫn là ngôn ngữ phổ biến nhất để nói về khả năng của AI. Việc xác định tự động có thể lặp lại và các con số sẽ giống nhau cho dù ai đo nó. Phẩm chất này vô cùng quý giá và không có lý do gì để phủ nhận nó.
Tuy nhiên, thành thật mà nói, nó không phải là tài liệu tốt để so sánh các điểm được công bố. Vì k, n, nhiệt độ và các tập bài toán được sắp xếp khác nhau nên bảng ngang hầu như không có ý nghĩa gì. Chúng tôi tin rằng "pass@k 〇〇%" trong tài liệu của nhà cung cấp nhỏ hơn giá trị tham chiếu trừ khi có ghi các điều kiện.
Nếu bạn muốn thu hẹp nó thành một mục đích sử dụng, pass@1, đo lường 50 câu hỏi từ nhiệm vụ của công ty bạn, là lựa chọn tốt nhất. Quyết định giới thiệu hệ thống này liên quan trực tiếp hơn đến việc bạn có thể vượt qua nó trong một lần làm việc của mình tốt như thế nào hơn là xếp hạng trên băng ghế dự bị bên ngoài. Phải mất vài ngày để thực hiện, nhưng nó sẽ trở thành một tài sản hữu ích hơn mỗi khi mô hình được thay thế.
Và nếu bạn đang giả sử tự động hóa, hãy xem pass^k thay vì pass@k. Khi bạn gặp khó khăn trong việc đạt được 90% gấp 10 lần về số lượng, bạn tự nhiên quyết định nên đưa vào xác nhận của con người ở đâu. Đừng sợ số thấp. Chỉ những nhóm nhìn thẳng vào vấn đề này mới có thể đạt được sự tự động hóa không có tai nạn.
Các câu hỏi thường gặp (FAQ)
Q.Tôi nên xem cái nào, pass@1 hay pass@10?
Nếu bạn muốn kết hợp nó vào tự động hóa, hãy sử dụng pass@1 và nếu bạn muốn sử dụng nó để chọn ứng viên, hãy sử dụng pass@5 đến 10. Nếu tài liệu chứa cả hai, kích thước của sự khác biệt thể hiện giá trị của việc sắp xếp ứng viên. Một mô hình có sự khác biệt nhỏ cũng có nghĩa là dù bạn có chạy bao nhiêu lần thì nó cũng chỉ trả về những câu trả lời tương tự.
Q. Nếu pass@k cao, điều đó có nghĩa là nó có thể được sử dụng cho công việc phải không?
Không nhất thiết phải như vậy. pass@k chỉ xem xét liệu bài kiểm tra có vượt qua hay không, vì vậy khả năng đọc, độ an toàn và tốc độ thực thi không được đánh giá. Cuối cùng, mọi người sẽ chịu trách nhiệm xem xét mã đã vượt qua bài kiểm tra.
Q. Bạn tính pass^k như thế nào?
Nếu tỷ lệ thành công trên mỗi lần thử là p thì nó xấp xỉ p^k. Nói đúng ra, đây là một phép tính gần đúng có tính độc lập giữa các phép thử, nhưng nó đủ để ước tính thực tế. Nếu bạn kết nối 20 bước với tỷ lệ thành công là 95%, bạn có thể tính ra con số đó là khoảng 36%.
Q. Bao nhiêu câu hỏi là đủ cho điểm chuẩn của công ty tôi?
Ít nhất 50 câu hỏi, tốt nhất là 100 câu hỏi. Nếu có ít hơn 50 câu hỏi, mỗi câu hỏi sẽ di chuyển nhiều hơn 2 điểm, gây khó khăn cho việc đọc ra những khác biệt nhỏ giữa các mô hình. Một cách thiết thực để bắt đầu là tạo 30 câu hỏi dựa trên các nhiệm vụ thường gặp nhất và bổ sung thêm khi bạn sử dụng chúng.
Q. Tôi nên đặt cài đặt nhiệt độ nào?
Nếu bạn muốn đo pass@1, hãy đặt nó ở mức thấp (khoảng 0 đến 0,2) và nếu bạn muốn thấy sự đa dạng với k lớn, hãy đặt nó ở mức cao. Điều quan trọng là mỗi lần thực hiện phép đo, cùng một giá trị được sử dụng chứ không phải chính giá trị đó. Nếu điều này tắt, việc so sánh với lần trước sẽ không được giữ nguyên.
Câu hỏi: Tôi có thể tự mình kiểm tra tình trạng ô nhiễm dữ liệu không?
Xác nhận hoàn toàn là không thể. Tuy nhiên, nếu có sự khác biệt, chẳng hạn như một người đạt điểm rất cao ở cơ quan công quyền nhưng lại ở mức trung bình trong các nhiệm vụ nội bộ, thì đây là dấu hiệu nghi ngờ có sự ô nhiễm. Đó là lý do tại sao việc có những vấn đề của riêng mình mà không bị phơi bày là điều đáng giá.
Câu hỏi: Tôi có thể đo lường các nhiệm vụ khác ngoài mã không?
Nếu nó có thể tự động xác định đạt/không đạt thì có thể đo được. Nó tương thích với việc trích xuất, phân loại và chuyển đổi định dạng dữ liệu. Những bài tập không có câu trả lời đúng duy nhất, chẳng hạn như bài viết hay hay dở, cần được kết hợp với các phương pháp đánh giá khác.
Xem các so sánh/lựa chọn thay thế liên quan
Khi bạn đã xác định được tiêu chí đánh giá của mình, đã đến lúc thu hẹp các mục tiêu so sánh của bạn.
- So sánh ChatGPT và Claude - Sự khác biệt về độ ổn định của thế hệ và xu hướng xử lý văn bản dài
- So sánh Claude và Gemini - Cân bằng giữa việc tạo mã và đọc hiểu
- So sánh GitHub Copilot và Cursor - Sự khác biệt về khả năng sử dụng của loại tích hợp IDE
- So sánh ChatGPT và Gemini - phạm vi là trợ lý đa năng
- Các lựa chọn thay thế cho GitHub Copilot — Danh sách các lựa chọn thay thế tiềm năng
- Chi tiết công cụ ChatGPT / Chi tiết công cụ Claude — Thông tin cơ bản về giá cả và tính năng
- AI agent - một bộ công cụ được thiết kế để thực hiện tự động
Nếu bạn muốn đọc phần tiếp theo: Nếu bạn chọn giao phó tự động hóa, chúng tôi khuyên bạn nên kết hợp AI vào công việc kiểm tra nội bộ. Bạn có thể lấy ví dụ cụ thể về nơi thay thế số pass^k bằng kiểm tra của con người.
ChatGPT là chatbot AI hỗ trợ trả lời câu hỏi, tạo văn bản, sắp xếp thông tin và tạo ý tưởng thông qua đối thoại tự nhiên. Bạn có thể thực hiện các tác vụ dựa trên văn bản như tóm tắt văn bản dài, soạn thảo email và đề xuất, dịch, diễn giải và sắp xếp chúng dưới dạng bảng trong khi trò chuyện. Chúng tôi còn cung cấp dịch vụ tạo mã lập trình, xác nhận nguyên nhân lỗi, giải thích nội dung học tập và tư vấn bằng hình ảnh. Nó phù hợp cho những người dùng muốn sử dụng nó cho nhiều mục đích khác nhau, từ nghiên cứu cá nhân đến hỗ trợ tạo và phát triển tài liệu kinh doanh.
Trang web chính thức của từng công cụ (thông tin chính)
Giá cả, chức năng và phạm vi hỗ trợ là thông tin chính được cung cấp bởi trang web chính thức của mỗi công ty. Bài viết này dựa trên xác minh tại thời điểm xuất bản, nhưng hãy nhớ kiểm tra từng trang chính thức để biết các điều kiện chính xác và mới nhất.
- ChatGPT — Trang web chính thức (xem chi tiết)
- Claude — Trang web chính thức (xem chi tiết)
- GitHub Copilot — Trang web chính thức (xem chi tiết)
Claude là một chatbot AI được phát triển bởi Anthropic, hỗ trợ hiểu, tạo, tóm tắt và phân tích văn bản theo cách trò chuyện tự nhiên. Nó có thế mạnh trong việc đọc các văn bản dài và sắp xếp các vấn đề, đồng thời có thể tóm tắt nội dung giấy tờ, hợp đồng, báo cáo, biên bản, v.v. và rút ra những điểm và rủi ro quan trọng. Chúng tôi cũng có thể trợ giúp soạn thảo email, đề xuất và tài liệu kinh doanh, diễn giải văn bản và tư vấn về quy tắc. Nó phù hợp cho các cá nhân và người dùng doanh nghiệp muốn hợp lý hóa việc nghiên cứu, viết và tạo tài liệu kinh doanh đồng thời nhấn mạnh tính chính xác và giải thích chi tiết.
Bài viết liên quan
- AI sáng tạo là gì? Cách chọn bằng cách so sánh 5 loại và 30 công cụ (phiên bản 2026)
- Các công cụ cần thiết và chi phí hàng tháng cho công việc phụ mã hóa AI | Cấu hình khởi động miễn phí cũng có sẵn (phiên bản 2026)
- Cách bắt đầu công việc phụ về mã hóa AI | Chi phí ban đầu và các bước thực hiện dự án đầu tiên (ấn bản năm 2026)
- AI có thể làm gì cho các công ty khởi nghiệp CNTT? 15 công dụng thực tế (ấn bản 2026)
- Nâng cao hiệu quả hoạt động QA với AI | Các bước thực hiện và cạm bẫy để lấy lại 10 giờ mỗi tháng (ấn bản năm 2026)