DocVQA là chuẩn mực đo lường khả năng hiểu tài liệu và độ chính xác OCR của mô hình AI bằng cách đặt câu hỏi và trả lời các câu hỏi về hình ảnh tài liệu được quét như hóa đơn, hợp đồng.
DocVQA được sử dụng làm tiêu chuẩn ngành để đo lường xem liệu các mô hình AI có thể trả lời chính xác các câu hỏi hay không bằng cách đặt câu hỏi về hình ảnh của các tài liệu có bố cục phức tạp, chẳng hạn như hóa đơn, hợp đồng và biểu mẫu đơn đăng ký. Nó được đặc trưng bởi khả năng đánh giá không chỉ độ chính xác OCR đơn giản mà còn cả khả năng đọc hiểu dựa trên bố cục bảng và cấu trúc bố cục. Tuy nhiên, ngay cả khi điểm chuẩn cao, vẫn có trường hợp độ chính xác giảm trong hoạt động thực tế do ký tự viết tay, bản quét có độ phân giải thấp và tài liệu bằng nhiều ngôn ngữ, do đó, cần phải tiến hành kiểm tra PoC bằng cách sử dụng các mẫu tương tự như tài liệu nội bộ trước khi triển khai tại hiện trường. Tính đến năm 2026, tất cả các LLM đa phương thức lớn đều công bố điểm DocVQA cao, nhưng phải cẩn thận khi thực hiện các so sánh đơn giản vì các điều kiện tiên quyết về điểm số (ngôn ngữ và loại tài liệu) là khác nhau. Về chi phí, định giá trả theo mức sử dụng dựa trên lệnh gọi API là phổ biến và khi xử lý khối lượng lớn tài liệu, bạn nên ước tính giá hàng tháng trước khi chọn mô hình.