Dia là mô hình AI tổng hợp giọng nói đàm thoại mã nguồn mở do Nari Labs ở Mỹ phát triển và là công nghệ có thể tạo ra mọi thứ từ chữ viết đến âm thanh phi ngôn ngữ như tiếng cười và tiếng ho cùng một lúc.
Dia là mô hình tổng hợp giọng nói đối thoại mã nguồn mở với 1,6 tỷ tham số do công ty khởi nghiệp Nari Labs của Hàn Quốc phát hành. Nó được cho là khác biệt so với TTS tiêu chuẩn ngành ở chỗ nó có thể tạo ra đoạn hội thoại tự nhiên, bao gồm cả thay đổi người nói, trong một lần truyền bằng cách chuyển văn bản kịch bản và nó cũng có thể thể hiện những âm thanh không lời như tiếng cười và tiếng ho bằng cách sử dụng các thẻ như [cười] và [ho]. Nó cũng có thể được sử dụng làm bản sao giọng nói để điều chỉnh chất lượng giọng nói và giai điệu cảm xúc bằng cách đưa ra lời nhắc bằng giọng nói và có sẵn miễn phí trên GitHub và Hugging Face theo giấy phép Apache 2.0. Trong thực tế vận hành đến năm 2026, cạm bẫy lớn nhất của lĩnh vực này là chỉ hỗ trợ tiếng Anh, không hỗ trợ thế hệ tiếng Nhật, không sử dụng được như các dự án của Nhật. Nếu bạn dự định lưu trữ GPU của riêng mình, tiêu chuẩn là khoảng 10GB VRAM và không giống như các API thương mại, sẽ không có phí trả cho mỗi lần sử dụng nhưng chi phí cơ sở hạ tầng và nỗ lực vận hành sẽ được cộng vào chi phí. Xét về giá thị trường, rào cản ban đầu để triển khai cao hơn so với các API thoại đối thoại thương mại như ElevenLabs, nhưng nó đang thu hút sự chú ý trong lĩnh vực này như một lựa chọn cho các nhà phát triển muốn giảm chi phí vận hành và cho mục đích nghiên cứu.