Từ điển phát âm (đọc từ điển) là dữ liệu từ điển đăng ký cách phát âm và trọng âm cho từng từ để AI tổng hợp giọng nói và hệ thống nhận dạng giọng nói có thể phát âm và nhận dạng các thuật ngữ kỹ thuật, danh từ riêng, từ viết tắt theo cách phát âm chính xác.
Từ điển phát âm được sử dụng làm tiêu chuẩn ngành trong công cụ chuyển văn bản sang giọng nói (TTS) và nhận dạng giọng nói (ASR) như một cơ chế để chỉ định riêng cách phát âm của các từ không thể được xử lý chính xác chỉ bằng mô hình ngôn ngữ thông thường. Tên công ty, tên sản phẩm, tên người, chữ viết tắt và thuật ngữ kỹ thuật thường được nhắm mục tiêu và chúng có thể bị đọc sai bởi các quy tắc ước tính đọc chung. Trong hoạt động thực tế kể từ năm 2026, chi phí vận hành đăng ký từ điển sẽ là một cạm bẫy thường bị bỏ qua. Từ điển cần được cập nhật liên tục khi các danh từ riêng mới được thêm vào và nếu không được chọn, việc đọc sai sẽ tích lũy và làm giảm trải nghiệm người dùng. Hơn nữa, do định dạng đăng ký (ký hiệu âm vị, loại dấu, v.v.) của từ điển khác nhau tùy thuộc vào công cụ, nên việc quản lý từ điển kép có thể xảy ra ở các trang web sử dụng nhiều dịch vụ TTS/ASR cùng nhau. Khi chọn từ điển, điều quan trọng là phải kiểm tra xem có thể đăng ký và cập nhật từ điển liên tục từ API hoặc UI hay không, liệu có thể kiểm soát chính xác các loại giọng hay không và liệu nó có tương thích với các ngôn ngữ và có khả năng chống biến động chính tả hay không. Khả năng sử dụng thực tế sẽ khác nhau rất nhiều tùy thuộc vào việc liệu nó có đủ linh hoạt để được tích hợp vào quy trình vận hành hay không chứ không chỉ đơn giản là vì nó tương thích.