Tạo phụ đề tự động là công nghệ sử dụng AI để nhận dạng nội dung giọng nói từ video, âm thanh và tự động tạo phụ đề (caption) đồng bộ với mã thời gian.
Tạo phụ đề tự động là công nghệ sử dụng công nghệ nhận dạng giọng nói (ASR) để chuyển đổi lời nói của nội dung video, âm thanh thành văn bản và tự động tạo phụ đề được đồng bộ hóa với mã thời gian. Các dịch vụ dựa trên mô hình nhận dạng giọng nói như Whisper đã trở thành tiêu chuẩn ngành. Số lượng công cụ bao gồm tách loa, chèn dấu chấm câu và chức năng đăng ký từ điển thuật ngữ chuyên ngành ngày càng tăng và những công cụ này được sử dụng rộng rãi để chỉnh sửa video ngắn cho YouTube và TikTok, tạo biên bản cuộc họp và tạo tài liệu học tập điện tử. Tuy nhiên, trong hoạt động thực tế kể từ năm 2026, độ chính xác của nhận dạng có thể giảm do danh từ riêng, thuật ngữ kỹ thuật, phương ngữ và cách phát âm đồng thời của nhiều người nói và quá trình hiệu đính thủ công sau khi tạo được giả định tại hiện trường. Cấu trúc giá phổ biến là gói miễn phí + trả theo mức sử dụng (mỗi phút), với mức giá trung bình từ vài nghìn yên Nhật mỗi tháng đến hơn 10.000 yên Nhật mỗi tháng cho các gói cao cấp hơn bao gồm tính năng tách loa và hỗ trợ đa ngôn ngữ. Khi lựa chọn, điều quan trọng là phải kiểm tra ngôn ngữ được hỗ trợ, độ chính xác tách loa, định dạng xuất (tương thích SRT/VTT) và khả năng tương thích với phần mềm chỉnh sửa hiện có cũng như xác minh độ chính xác bằng cách sử dụng tài liệu âm thanh thực tế trong bản dùng thử.