Tổng hợp giọng nói zero-shot là công nghệ tìm hiểu chất lượng giọng nói và ngữ điệu của người nói chỉ từ vài giây mẫu âm thanh và đọc văn bản chưa học một cách tự nhiên.
Tổng hợp giọng nói thông thường yêu cầu đào tạo một mô hình chuyên dụng sử dụng dữ liệu được ghi trong vài giờ cho mỗi người nói, nhưng Zero Shot TTS trích xuất các tính năng như chất lượng giọng nói, tốc độ nói và ngữ điệu từ vài giây đến vài chục giây của lời nói tham chiếu và được đặc trưng bởi khả năng đọc ngay lập tức bất kỳ văn bản nào. Đến năm 2026, nó sẽ được áp dụng rộng rãi trong các hoạt động thực tế như đọc tóm tắt biên bản cuộc họp, tạo thuyết minh, lồng tiếng bằng nhiều ngôn ngữ. Tuy nhiên, nó có xu hướng khiến các biểu hiện cảm xúc và ngữ điệu trở nên không tự nhiên khi sử dụng các thuật ngữ kỹ thuật và sẽ cần phải kiểm tra thủ công âm thanh đầu ra tại hiện trường. Ngoài ra, vì chất lượng giọng nói rất dễ bị trùng lặp nên các vấn đề bao gồm nguy cơ lạm dụng giọng nói giả mạo và việc thiết lập các quy tắc hoạt động để có được sự đồng ý. Giá thị trường dao động từ các dịch vụ trả tiền theo mức sử dụng API giá thấp cho đến các gói chất lượng cao dành cho tường thuật thương mại và cần đưa ra lựa chọn dựa trên sự cân bằng giữa mức sử dụng và chi phí.