ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

pass^k (số liệu nhất quán)

pass^k là chỉ số đánh giá tính nhất quán để đo lường độ tin cậy bằng cách yêu cầu một mô hình AI tổng quát thực hiện cùng một nhiệm vụ k lần và xác định tỷ lệ phần trăm câu trả lời đúng/thành công trong tất cả k lần.

Trong khi tiêu chuẩn ngành pass@k tuyên bố rằng một bài kiểm tra sẽ đạt nếu nó thành công dù chỉ 1 trên k lần, thì pass^k (còn được gọi là tính nhất quán@k) là một chỉ số đánh giá tính nhất quán chặt chẽ hơn cho biết rằng bài kiểm tra sẽ đạt nếu nó thành công tất cả k lần. Mặc dù nó có vẻ có độ chính xác cao trong bản demo một lần, nhưng nó là số liệu được sử dụng để trực quan hóa các trường hợp trong đó việc sử dụng dựa trên lần thử không hoạt động trong các hoạt động thực tế và được cho là được sử dụng rộng rãi trong việc tạo mã và xác minh độ tin cậy của các nhiệm vụ của tổng đài viên. Đối với chi phí tại hiện trường tính đến năm 2026, việc tính toán pass^k yêu cầu k nhân với chi phí suy luận, do đó, có một rủi ro là chi phí API có xu hướng tăng lên khi sử dụng k lớn như k = 5 hoặc k = 10 trong xác minh thực tế. Ngoài ra, khi k tăng, điểm có xu hướng giảm nhanh và việc so sánh các mô hình được đo với các giá trị k khác nhau có thể dễ dẫn đến những nhận định không chính xác về sự vượt trội hay thua kém. Đối với phương pháp lựa chọn tại hiện trường, việc đầu tiên xác nhận tiềm năng bằng pass@k được coi là thực tế, sau đó dần dần giới thiệu pass^k bắt đầu từ một k nhỏ để kiểm tra độ tin cậy trước khi triển khai thực tế.

Thuật ngữ liên quan