ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Giọng nói thời gian thực

Giọng nói thời gian thực là công nghệ trong đó AI nhận dạng và tạo đầu vào bằng giọng nói với độ trễ gần như bằng 0, đạt tốc độ phản hồi gần bằng tốc độ hội thoại của con người.

Giọng nói thời gian thực là hệ thống kết hợp nhận dạng giọng nói (STT), LLM và tổng hợp giọng nói (TTS) thành một đường dẫn và hoàn tất quy trình từ khi bắt đầu lời nói đến đầu ra của giọng nói phản hồi trong thời gian chưa đầy 500 mili giây. API thời gian thực OpenAI và API trực tiếp Gemini sẽ lần lượt được phát hành từ năm 2024 đến năm 2025 và vào năm 2026, hoạt động thực tế sẽ bắt đầu một cách nghiêm túc tại các trung tâm cuộc gọi trong nước, phỏng vấn y tế và học ngôn ngữ. Khi ReviewAI điều tra các trường hợp thực địa, chủ yếu có ba cạm bẫy. ① Chi phí kết nối: Với kết nối liên tục WebSocket, chi phí tăng tỷ lệ thuận với số lượng kết nối đồng thời (giá thị trường so sánh: GPT-4o Realtime là 0,06 USD/phút cho đầu vào và 0,24 USD/phút cho đầu ra). ② Hỗ trợ Barge-in: Yêu cầu triển khai để dừng ngay giọng nói AI ngay khi người dùng nói, điều này làm phức tạp việc thiết kế. ③Độ chính xác của tiếng Nhật: Có nhiều trường hợp phản ứng với các từ đệm (chẳng hạn như "ừm") và phương ngữ kém hơn tiếng Anh. Tiêu chuẩn hiện tại kể từ năm 2026 là OpenAI Realtime nếu độ trễ thấp là ưu tiên hàng đầu của bạn, Gemini Live nếu chi phí là ưu tiên của bạn và cấu hình riêng biệt Whisper + TTS nếu bạn muốn xử lý cục bộ.

Thuật ngữ liên quan