ASR (Tự động nhận dạng giọng nói) là công nghệ tự động chuyển đổi giọng nói của con người thành văn bản. Với sự phổ biến của các mô hình deep learning, độ chính xác của chúng đã được cải thiện đáng kể và hiện được sử dụng trong nhiều ứng dụng, bao gồm phiên âm, ra lệnh bằng giọng nói và dịch thuật.
ASR (Nhận dạng giọng nói tự động) là công nghệ phân tích dạng sóng giọng nói và chuyển đổi chúng thành văn bản. Độ chính xác của nó đã được cải thiện đáng kể kể từ khi kiến trúc Transformer lan rộng. Trong hoạt động thực tế tính đến năm 2026, bốn công nghệ chính là OpenAI Whisper big-v3, Google STT v2, Azure Custom Speech và AWS Transcribe.
Theo ước tính của thị trường, API đám mây có giá khoảng 0,4 đến 0,9 USD mỗi giờ âm thanh. Whisper tự lưu trữ có thể giảm chi phí xuống gần như bằng 0, nhưng chi phí bảo trì GPU, nhận dạng sai danh từ riêng tiếng Nhật và lỗ hổng đối với những người nói nhiều thứ tiếng có thể dễ dàng trở thành cạm bẫy trong lĩnh vực này. Trong các lĩnh vực y tế, pháp lý và tài chính, việc chuẩn bị hoặc tinh chỉnh các từ điển thuật ngữ chuyên ngành là thực tế cần thiết.
Hướng dẫn lựa chọn khác nhau tùy thuộc vào mục đích. 1. Đối với các ứng dụng không theo thời gian thực như biên bản cuộc họp và phụ đề, xử lý hàng loạt Whisper phiên bản lớn v3 là hiệu suất chi phí tốt nhất. 2. Đối với các yêu cầu thời gian thực như trung tâm cuộc gọi, Azure STT Streaming hoặc Google STT Streaming. 3. Đối với các dự án toàn cầu cần hỗ trợ đa ngôn ngữ, Whisper multilingual hoặc Deepgram là những ứng cử viên nặng ký. Hầu hết các công cụ AI giọng nói được giới thiệu tại ReviewAI đều được xây dựng trên lớp ASR này và việc lựa chọn ASR phù hợp với ứng dụng sẽ ảnh hưởng trực tiếp đến chất lượng dịch vụ và chi phí vận hành.