Chatterbox là mô hình chuyển văn bản thành giọng nói (TTS) mã nguồn mở do Resemble AI phát hành, đây là công nghệ có thể tái tạo giọng nói từ những âm thanh ngắn và điều chỉnh cường độ cảm xúc.
Chatterbox là một mô hình tổng hợp chuyển văn bản thành giọng nói (TTS) được Resemble AI phát hành dưới dạng mã nguồn mở vào năm 2025. Nó được cho là tạo sự khác biệt với TTS thương mại tiêu chuẩn ngành nhờ tính năng sao chép giọng nói không cần ngắt quãng, tái tạo âm sắc giọng nói của người nói chỉ bằng một vài giây âm thanh tham chiếu và bằng khả năng điều chỉnh cường độ cảm xúc (cường điệu) bằng các tham số số. Giấy phép cho phép sử dụng thương mại và nếu bạn chạy nó trên máy chủ của riêng mình, nó được cho là rẻ hơn so với dịch vụ trả tiền theo mức sử dụng API. Tuy nhiên, trong thực tế sử dụng tính đến năm 2026, độ tự nhiên của tiếng Nhật và độ chính xác của giọng được cho là đi trước một bước so với các mô hình dành cho người nói tiếng Anh bản xứ, vì vậy nên so sánh và xác minh với các mô hình khác cho mục đích tường thuật tiếng Nhật tại hiện trường. Việc bảo mật GPU và tối ưu hóa tốc độ suy luận cũng được coi là trở ngại cho hoạt động tại chỗ.