SSML là ngôn ngữ đánh dấu dựa trên XML cho phép kiểm soát chi tiết cách phát âm, tốc độ, tạm dừng, ngữ điệu, v.v. cho các công cụ chuyển văn bản thành giọng nói (TTS).
SSML là thông số kỹ thuật để kiểm soát tổng hợp giọng nói được tiêu chuẩn hóa bởi W3C và là tiêu chuẩn ngành được hỗ trợ bởi các nền tảng chính như Google Cloud TTS, Amazon Polly, Azure Cognitive Speech và API TTS của OpenAI. Bạn có thể chèn khoảng dừng im lặng bằng thẻ `<break>`, điều chỉnh tốc độ, âm lượng và cao độ bằng `<prosody>` và chỉ định cách đọc số, ngày tháng và số điện thoại bằng `<say-as>`.
Kể từ năm 2026, một cạm bẫy trong hoạt động thực tế là sự khác biệt nghiêm trọng về phương ngữ giữa các nền tảng. Các vấn đề về khả năng tương thích thường xảy ra trong trường, chẳng hạn như các thẻ của chính Google bị Amazon Polly bỏ qua và Azure yêu cầu các tiện ích mở rộng duy nhất như `<mstts:express-as>`. Do API TTS của OpenAI không hỗ trợ SSML và chỉ chấp nhận văn bản thô nên thường phải viết lại hoàn toàn logic điều khiển khi chuyển đổi.
Về mặt chi phí, nhiều nền tảng không bao gồm thẻ SSML trong số lượng ký tự, nhưng Google Cloud có thông số kỹ thuật trong đó một số thẻ được thêm vào số lượng ký tự được tính phí, điều này có thể dẫn đến sai số vài nghìn yên Nhật với tỷ lệ 1 triệu ký tự mỗi tháng. Từ góc độ hoạt động thực tế của ReviewAI, trước tiên nên kiểm tra xem OpenAI TTS (đơn giản và chất lượng cao) có đáp ứng các yêu cầu hay không, sau đó chọn Google/Azure/Polly chỉ hỗ trợ SSML nếu cần kiểm soát giọng nói chi tiết về mặt hiệu quả chi phí.