Kokoro là mô hình chuyển văn bản thành giọng nói (TTS) mã nguồn mở nhẹ, có thể tạo ra giọng nói chất lượng cao với một số lượng nhỏ tham số.
Kokoro là một mô hình chuyển văn bản thành giọng nói (TTS) mã nguồn mở nhẹ, được đặc trưng bởi khả năng tạo ra giọng nói tự nhiên trong khi vẫn giữ kích thước mô hình nhỏ. Nó không yêu cầu phí cấp phép như các API thương mại như ElevenLabs và dễ dàng hoạt động trong môi trường cục bộ hoặc biên, do đó, nó được cho là được áp dụng rộng rãi bởi các nhà phát triển muốn giảm chi phí và tạo nguyên mẫu trong quá trình phát triển cá nhân. Mặt khác, trong hoạt động thực tế kể từ năm 2026, sự đa dạng về ngôn ngữ và người nói được hỗ trợ sẽ không phong phú như các dịch vụ thương mại và tính tự nhiên của ngữ điệu và biểu hiện cảm xúc của tiếng Nhật sẽ chậm hơn một bước so với TTS đám mây lớn. Hơn nữa, người ta đã chỉ ra rằng có những trường hợp chi phí không giảm nhiều như mong đợi vì bạn cần phải tự chuẩn bị tài nguyên GPU và CPU thay vì trả tiền như với các API thương mại. Về cách lựa chọn trong trường, thông thường nên sử dụng TTS nguồn mở nhẹ như Kokoro để tạo hàng loạt và xử lý hàng loạt, cũng như TTS thương mại cho nội dung của khách hàng trong đó chất lượng và khả năng biểu cảm của người nói là quan trọng.