Cartesia là thuật ngữ dùng để chỉ một công ty khởi nghiệp phát triển mô hình tổng hợp giọng nói có độ trễ thấp (TTS) bằng cách sử dụng kiến trúc Mô hình không gian trạng thái (SSM) hoặc chính mô hình đó.
Cartesia được biết đến là một công ty khởi nghiệp cung cấp mô hình tổng hợp giọng nói (TTS) sử dụng kiến trúc Mô hình không gian trạng thái (SSM) thay vì Transformer và sản phẩm đại diện ``Sonic'' của nó được cho là được áp dụng rộng rãi như một lựa chọn cho các AI agent thoại thời gian thực do độ trễ thấp. Trong khi tiêu chuẩn ngành là TTS dựa trên Transformer như ElevenLabs về chất lượng âm thanh và hỗ trợ đa ngôn ngữ, Cartesia được cho là đang tạo sự khác biệt với tốc độ phản hồi nhanh bằng cách sử dụng tính năng phát trực tuyến WebSocket. Trong hoạt động thực tế kể từ năm 2026, tính tự nhiên và biểu hiện cảm xúc ở các quốc gia không nói tiếng Anh, bao gồm cả tiếng Nhật, được cho là đang được phát triển so với các công ty hàng đầu như ElevenLabs và trong lĩnh vực này, giao diện người dùng giọng nói thời gian thực dựa trên tiếng Anh (AI của trung tâm cuộc gọi, agent thoại) đang được áp dụng đầu tiên. Về mặt chi phí, phí trả theo mức sử dụng thường dựa trên mức sử dụng (số ký tự/lần) và chi phí vận hành của phần TTS có xu hướng chiếm tỷ lệ không đáng kể trong số các sản phẩm ưu tiên độ trễ thấp. Về cách lựa chọn tại hiện trường, sự khác biệt thực tế là so sánh loại Cartesia dành cho các ứng dụng đối thoại thời gian thực có yêu cầu nghiêm ngặt về độ trễ và TTS của các công ty khác dành cho các ứng dụng ưu tiên chất lượng giọng nói và hỗ trợ đa ngôn ngữ.