Nhận dạng giọng nói trực tuyến (Streaming ASR) là công nghệ chuyển đổi dữ liệu âm thanh thành văn bản ngay khi được nói ra, thay vì sau khi quá trình ghi âm hoàn tất và được sử dụng để tạo phụ đề và phản hồi ngay lập tức từ trợ lý giọng nói.
Về mặt kỹ thuật, tiêu chuẩn ngành là truyền âm thanh một cách tuần tự qua bộ mã hóa theo từng đoạn và cập nhật các giả thuyết chưa được xác nhận (kết quả nhận dạng một phần) khi cần để hội tụ về văn bản cuối cùng. Mặc dù nó có độ trễ thấp hơn so với nhận dạng giọng nói xử lý hàng loạt, nhưng có sự cân bằng giữa độ chính xác và tốc độ, đồng thời việc dễ dàng nhận dạng sai thuật ngữ kỹ thuật hoặc giọng nói trung là một cạm bẫy trong hoạt động thực tế ngay cả vào năm 2026. Việc thanh toán API thường dựa trên hệ thống trả tiền theo mức sử dụng dựa trên thời gian thoại và chi phí xử lý thời gian thực có xu hướng tăng tùy thuộc vào số lượng kết nối đồng thời, do đó, điều quan trọng là phải ước tính chi phí trước. Tại hiện trường, quyết định được đưa ra rộng rãi là chọn giữa loại phát trực tuyến và loại hàng loạt, tùy thuộc vào việc độ trễ thấp có cần thiết hay không, chẳng hạn như phụ đề và thông dịch, hay độ chính xác sau khi thực tế là quan trọng, chẳng hạn như biên bản cuộc họp.