ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Truyền phát TTS

Truyền trực tuyến TTS là một phương pháp tổng hợp giọng nói giúp giảm đáng kể độ trễ phản hồi nhận thấy bằng cách phát lại từng đoạn âm thanh được tạo ra mà không cần đợi quá trình chuyển đổi văn bản sang giọng nói hoàn tất.

Truyền trực tuyến TTS là phương pháp trong đó mô hình tổng hợp giọng nói lần lượt gửi các đoạn âm thanh được tạo đến máy khách mà không cần đợi toàn bộ câu được tạo. Tiêu chuẩn ngành là triển khai chuyển đoạn WebSocket hoặc HTTP. TTS hàng loạt thông thường trả về tệp âm thanh sau khi tạo toàn bộ văn bản, dẫn đến độ trễ từ vài trăm mili giây đến vài giây, nhưng TTS truyền trực tuyến có thể trả về đoạn âm thanh đầu tiên trong khoảng hàng chục mili giây đến 100 mili giây, khiến nó có khả năng tương thích cao với agent giọng nói và giao diện người dùng hội thoại thời gian thực. Trong hoạt động thực tế kể từ năm 2026, nó sẽ được áp dụng rộng rãi trong trợ lý AI tương tác bằng giọng nói và phản hồi tự động của trung tâm cuộc gọi, nhưng trên thực tế, những khoảng dừng bất thường do độ trễ mạng và vị trí phân chia đoạn có thể là một cạm bẫy và điều quan trọng là phải thiết kế các đoạn trên cơ sở âm vị/mã thông báo thay vì trên cơ sở câu. Về mặt giá thị trường, ngoài phí sử dụng trả theo mức tương tự như TTS thông thường, có nhiều trường hợp cộng thêm chi phí duy trì kết nối liên tục và cần lưu ý rằng số lượng kết nối đồng thời càng lớn thì tác động đến cơ cấu chi phí càng lớn. Khi thực hiện lựa chọn, phương pháp tiêu chuẩn là so sánh tính tự nhiên của các ngôn ngữ được hỗ trợ, hỗ trợ gián đoạn và SLA độ trễ.

Thuật ngữ liên quan