ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

TruthfulQA (TruthfulBench)

TruthfulQA (Tiêu chuẩn trung thực) là một tiêu chuẩn đo lường xem liệu một mô hình ngôn ngữ quy mô lớn có thể trả lại câu trả lời chính xác dựa trên thực tế mà không bị ảnh hưởng bởi những quan niệm sai lầm và huyền thoại phổ biến ở con người hay không.

TruthfulQA là điểm chuẩn được các nhà nghiên cứu từ OpenAI và Đại học Oxford công bố vào năm 2021 để đo lường mức độ “trung thực” của các mô hình ngôn ngữ quy mô lớn. Đây là một hệ thống trong đó các mô hình được chấm điểm về việc liệu chúng có thể trả lời 817 câu hỏi mà con người dễ hiểu nhầm hay không, chẳng hạn như các truyền thuyết về y tế, pháp lý và đô thị, mà không chấp nhận những lầm tưởng và thành kiến ​​đã lan rộng khắp thế giới, đồng thời được cho là được sử dụng rộng rãi như một chỉ báo so sánh trong các báo cáo kỹ thuật của các mô hình lớn như GPT và Llama. Tuy nhiên, trong hoạt động thực tế kể từ năm 2026, ngay cả các mô hình có điểm cao cũng sẽ yếu trong việc kiểm tra tính xác thực cụ thể cho miền riêng của bạn và người ta cho rằng chúng sẽ được sử dụng cùng với RAG và các cơ chế xác minh tính xác thực trong hiện trường. Nếu bạn chọn một mô hình chỉ dựa trên điểm chuẩn độc lập thì có thể có sai lệch so với tỷ lệ ảo giác thực tế, do đó, phương pháp lựa chọn thực tế là xem xét chi phí của thử nghiệm tiếp theo bằng bộ đánh giá nội bộ và coi điểm chuẩn công khai là thông tin chính để hiểu được giá thị trường.

Thuật ngữ liên quan