Mã thông báo giọng nói là dữ liệu giọng nói được chia thành các đơn vị riêng biệt có thể được xử lý bằng AI tổng hợp giọng nói và nhận dạng giọng nói.
Mã thông báo giọng nói đề cập đến đơn vị xử lý dữ liệu nhỏ nhất thu được bằng cách nén dạng sóng giọng nói bằng bộ giải mã thần kinh và biểu thị nó dưới dạng chuỗi số rời rạc. Tương tự như mã thông báo văn bản, các mô hình AI giọng nói thường sử dụng đơn vị này để học, tạo và thanh toán API. Các API như chức năng Âm thanh của GPT-4o và hội thoại bằng giọng nói gốc của Gemini sử dụng tính năng thanh toán theo nhu cầu sử dụng dựa trên số lượng mã thông báo giọng nói cho cả đầu vào và đầu ra, đồng thời thực tế là số lượng mã thông báo được tiêu thụ thay đổi tùy thuộc vào tốc độ lấy mẫu và phương pháp codec ngay cả đối với cùng một cách nói, điều này có thể dễ dàng trở thành cạm bẫy trong hoạt động thực tế. Kể từ năm 2026, đơn giá của mã thông báo giọng nói thường sẽ cao hơn nhiều lần so với mã thông báo văn bản và người ta cho rằng chi phí có thể sẽ tăng nhiều hơn dự kiến nếu các cuộc trò chuyện thoại và số phút dài hạn được tạo thông qua API. Khi chọn một công cụ trong lĩnh vực này, mọi người đều biết rằng chi phí có thể phù hợp với giá thị trường bằng cách kiểm tra trước phương pháp nén của codec và hệ thống thanh toán của API, đồng thời chọn mô hình sử dụng codec tốc độ bit thấp cho các ứng dụng không yêu cầu hiệu suất thời gian thực.