OCR (Nhận dạng ký tự quang học) là công nghệ chuyển đổi các ký tự có trong hình ảnh được quét và tệp PDF thành dữ liệu văn bản có thể được xử lý bằng máy.
OCR là viết tắt của Nhận dạng ký tự quang học và là công nghệ chuyển đổi văn bản được ghi dưới dạng hình ảnh, chẳng hạn như tài liệu giấy, hóa đơn, danh thiếp, bản ghi nhớ viết tay và tệp PDF được quét thành dữ liệu kỹ thuật số. Các công cụ điển hình bao gồm Tesseract, Google Vision API và AWS Textract. Kể từ năm 2026, việc đa phương thức hóa LLM đã giúp GPT-4o và Gemini có thể trích xuất văn bản trực tiếp từ hình ảnh và quá trình chuyển đổi từ cấu hình hai giai đoạn của "công cụ chuyên dụng OCR + LLM" sang "LLM đa phương thức đơn" đang tăng tốc trong hoạt động thực tế.
Chủ yếu có ba cạm bẫy trong lĩnh vực này. ① Giảm độ chính xác với hình ảnh viết tay, nghiêng và độ phân giải thấp (đặc biệt cẩn thận với chữ Nhật dọc và bảng biểu phức tạp). ② Chi phí API bị bỏ qua: Google Vision API miễn phí cho 1.000 trang mỗi tháng, nhưng sau khi vượt quá giới hạn, chi phí khoảng 150 yên Nhật cho 1.000 trang và giá dường như tăng lên hàng chục nghìn yên Nhật mỗi tháng để xử lý trên quy mô lớn. ③ Chi phí tích hợp với đường dẫn RAG: Đầu ra OCR có nhiều nhiễu do ngắt dòng và khoảng trắng, đồng thời cần có bước xử lý trước khi phân đoạn, việc này tiêu tốn nhiều giờ công.
Từ góc độ ReviewAI, chúng tôi khuyên bạn nên sử dụng chúng theo cách khác nhau tùy theo mục đích. AWS Textract và Azure Form Photographer được sử dụng cho các biểu mẫu tiêu chuẩn (hóa đơn và biên lai), PDF-AI SaaS không tốn kém và dễ triển khai đối với các tài liệu PDF có mục đích chung, đồng thời các tài liệu viết tay và phi tiêu chuẩn được gửi trực tiếp đến LLM đa phương thức, có sự cân bằng tốt hơn giữa độ chính xác và công sức. Nếu khối lượng xử lý hàng tháng dưới 10.000 trang thì việc chọn một LLM Vision cho mục đích chung thường có lợi hơn về mặt tổng chi phí nếu chọn một LLM Vision có mục đích chung thay vì API OCR chuyên dụng.