Bộ mã hóa giọng nói là công nghệ chuyển đổi và tổng hợp giọng nói nhằm phân tích và tham số hóa các đặc tính tần số của giọng nói và tái tạo lại nó bằng cách sử dụng nguồn âm thanh hoặc dạng sóng tổng hợp khác.
Bộ mã hóa ban đầu xuất hiện như một công nghệ xử lý tín hiệu phân tách giọng nói thành các đặc điểm cho từng dải tần số (đường bao quang phổ và cao độ) và tái tạo lại giọng nói bằng cách thêm các đặc điểm giọng nói vào một nguồn âm thanh khác (âm thanh nhạc cụ hoặc dạng sóng tổng hợp) và đã được sử dụng trong sản xuất âm nhạc như một giọng nói và bộ hòa âm robot. Trong những năm gần đây, bộ phát âm thần kinh (loại WaveNet, HiFi-GAN, v.v.) được cho là đã trở thành công nghệ chính chịu trách nhiệm tạo dạng sóng ở giai đoạn cuối của TTS, chuyển đổi giọng nói và tổng hợp giọng hát. Trong hoạt động thực tế kể từ năm 2026, điều đáng tiếc là có thể xảy ra tiếng ồn và bị bóp nghẹt do loa, ngôn ngữ và biểu hiện cảm xúc khác với dữ liệu huấn luyện và theo nguyên tắc chung, chất lượng chuyển đổi giọng nói theo thời gian thực càng cao thì chi phí và độ trễ GPU càng cao. Khi chọn một mô hình tại hiện trường, độ trễ yêu cầu và dung sai chi phí sẽ khác nhau rất nhiều tùy thuộc vào việc mô hình đó được sử dụng để sản xuất giọng hát/âm nhạc hay chuyển đổi thời gian thực cho cuộc gọi/phân phối, vì vậy hướng dẫn thực tế là kiểm tra các mô hình và cơ sở hạ tầng riêng biệt cho từng mục đích sử dụng.