Kết xuất văn bản trong hình ảnh là công nghệ trong đó mô hình tạo hình ảnh AI vẽ chính xác các ký tự và từ được chỉ định trong hình ảnh. Điều quan trọng đối với các ứng dụng yêu cầu "văn bản có thể đọc được" như bảng quảng cáo, quảng cáo biểu ngữ và mô phỏng giao diện người dùng.
Kết xuất văn bản trong hình ảnh đề cập đến khả năng của mô hình khuếch tán, chẳng hạn như Stable Diffusion hoặc Midjourney, để tái tạo trực quan chuỗi ký tự được chỉ định trong lời nhắc trong hình ảnh. Các mô hình truyền bá thông thường không giỏi vẽ văn bản, thường dẫn đến các chuỗi ký hiệu vô nghĩa và các ký tự bị cắt xén. Kể từ năm 2026, DALL-E 3, Flux và Adobe Firefly sẽ hỗ trợ nhiều ngôn ngữ và có thể xuất 3 đến 8 ký tự chữ và số với độ chính xác thực tế.
Cạm bẫy lớn nhất trong lĩnh vực này là độ chính xác bị suy giảm khi sử dụng chữ Hán, câu dài và phông chữ trang trí. Đặc biệt, các ký tự kanji có tỷ lệ lỗi gấp ba đến bốn lần so với các ký tự chữ và số và hạn chế ``văn bản ngắn từ 2 đến 4 ký tự + phông chữ đậm màu trắng + nền đồng màu'' được cho là giới hạn trên thực tế cho việc sử dụng thực tế. Việc thêm hướng dẫn rõ ràng vào lời nhắc, chẳng hạn như "văn bản màu trắng đậm có nội dung 'BÁN HÀNG', có thể đọc được rõ ràng", sẽ tăng tỷ lệ thành công.
Trong quá trình xác minh sáng tạo quảng cáo của ReviewAI, mặc dù chi phí tạo cho mỗi hình ảnh là 0,03 đến 0,1 đô la nhưng chi phí thực tế thường tăng từ 3 đến 5 lần khi phần văn bản được tái tạo và chỉnh sửa sau. Kể từ năm 2026, giải pháp tiêu chuẩn cho các biểu ngữ được sản xuất hàng loạt là sử dụng các công cụ dành riêng cho thiết kế như Playground AI và Figma. Nếu độ chính xác của văn bản là ưu tiên hàng đầu thì Adobe Firefly hoặc DALL-E 3 sẽ được chọn và nếu chi phí là ưu tiên hàng đầu thì sự kết hợp giữa Flux + xử lý hậu kỳ sẽ được chọn.