Chuyển đổi giọng nói là công nghệ AI giúp chuyển đổi chất lượng giọng nói và âm sắc của người này sang người khác hoặc bất kỳ phong cách nào. Chỉ thay đổi đặc điểm của giọng nói trong khi vẫn giữ được nội dung ngôn ngữ của người nói.
Chuyển đổi giọng nói là công nghệ AI giúp chuyển đổi các đặc điểm như cao độ, âm sắc và chất lượng giọng nói của loa thành phong cách của loa mục tiêu khác. Không giống như tính năng chuyển văn bản thành giọng nói (TTS), nó độc đáo ở chỗ nó chỉ thay thế giọng nói trong khi vẫn giữ nguyên ngữ điệu, cảm xúc và thời gian của giọng nói gốc.
Trong hoạt động thực tế kể từ năm 2026, các mô hình nguồn mở như RVC (Chuyển đổi giọng nói dựa trên truy xuất) và So-VITS-SCVS sẽ được phổ biến rộng rãi, giúp thực hiện chuyển đổi có độ chính xác cao từ âm thanh mẫu vài chục giây. Chi phí trung bình trong lĩnh vực này là từ vài yên Nhật đến vài chục yên Nhật mỗi phút khi sử dụng API đám mây và chi phí chính cho việc tự lưu trữ là phí GPU ban đầu.
Trường hợp sử dụng phổ biến của ReviewAI là sản xuất tường thuật podcast, trong đó bản thảo được ghi bằng giọng của chính mình được chuyển thành phong cách của một người kể chuyện nổi tiếng và nó được sử dụng để giảm chi phí diễn viên lồng tiếng khi bản địa hóa nhiều ngôn ngữ. Cạm bẫy là nếu có ít dữ liệu huấn luyện, "sự suy giảm chất lượng âm thanh" và "cảm giác như người máy" có thể vẫn còn và độ chính xác của chuyển đổi sẽ giảm đáng kể nếu nguồn âm thanh có nhiều tạp âm. Hơn nữa, vẫn còn một vùng xám pháp lý liên quan đến quyền sở hữu quyền đối với âm thanh được chuyển đổi và cần phải xác nhận quyền trước khi sử dụng cho mục đích thương mại.