Thử nghiệm A/B nhanh chóng là phương pháp chuẩn bị nhiều đề xuất nhanh chóng cho cùng một nhiệm vụ, so sánh chất lượng đầu ra và chi phí, đồng thời chọn văn bản hướng dẫn tối ưu.
Thử nghiệm A/B được prompt là phương pháp chuẩn bị nhiều lời nhắc với cách diễn đạt, cấu trúc và tham số khác nhau cho cùng một nhiệm vụ hoặc câu hỏi, đồng thời so sánh và xác minh độ chính xác đầu ra, khả năng tái tạo, mức tiêu thụ mã thông báo, v.v. Nó được cho là một ứng dụng của ý tưởng thử nghiệm A/B trong phát triển phần mềm vào việc sử dụng LLM. Trong hoạt động thực tế kể từ năm 2026, tính ngẫu nhiên của đầu ra của mô hình khiến dễ mắc sai lầm trong các so sánh đơn lẻ và việc cần phải chạy cùng một lời nhắc nhiều lần và đánh giá nó dựa trên phân phối là một cạm bẫy đã biết trong thực tế. Ngoài ra, việc chỉ dựa vào đánh giá thủ công để đánh giá sẽ làm tăng số giờ công, do đó, phương pháp LLM-với tư cách là thẩm phán, trong đó LLM tự chấm điểm đầu ra và phương pháp LLM-với tư cách là thẩm phán, sử dụng các khung đánh giá hiện có, được áp dụng rộng rãi. Về mặt chi phí, phí sử dụng API tăng tỷ lệ thuận với số lượng lời nhắc được so sánh và số lượng lệnh gọi mô hình, do đó, thông lệ là bắt đầu bằng cách thu hẹp các tùy chọn xuống một số lượng nhỏ các biến thể và mẫu nhỏ, sau đó tiến hành theo từng giai đoạn bằng cách chỉ thử nghiệm những ứng viên có triển vọng với lưu lượng truy cập thực tế.