Moshi là mô hình AI hội thoại song công hoàn toàn do viện nghiên cứu AI Kyutai của Pháp phát triển, có thể nghe và nói cùng lúc đồng thời chặn và che lời nói của người khác, giống như trong cuộc trò chuyện của con người.
Moshi là mô hình tương tác giọng nói song công hoàn toàn, xử lý đồng thời mã thông báo văn bản và giọng nói trong cùng một Transformer, được phát hành vào năm 2024 bởi viện nghiên cứu AI của Pháp Kyutai. Trợ lý giọng nói thông thường xử lý nhận dạng giọng nói, suy luận LLM và tổng hợp giọng nói theo thứ tự này, mất vài trăm mili giây trở lên sau khi nói, nhưng Moshi thực hiện song song các quá trình nghe và nói và được cho là có thể phản hồi ở tốc độ gần với tốc độ trò chuyện của con người, bằng cách lặp lại lời nói của người khác. Nó có đặc điểm là thiết kế sử dụng codec âm thanh chuyên dụng để mã hóa và nén âm thanh trong khi vẫn duy trì chất lượng và do trọng số được công khai nên nó được đánh giá cao vì có thể chạy trên các máy chủ và thiết bị đầu cuối nội bộ. Tuy nhiên, trong hoạt động thực tế tính đến năm 2026, khả năng hiểu và tự nhiên của giọng nói bằng các ngôn ngữ không phải tiếng Anh và tiếng Pháp, đặc biệt là tiếng Nhật, được cho là kém hơn so với OpenAI và API giọng nói thời gian thực thương mại của Google, vì vậy việc xác minh so sánh tùy thuộc vào ứng dụng là điều cần thiết trong lĩnh vực này. Về mặt chi phí, mặc dù bản thân trọng lượng là miễn phí nhưng cơ sở hạ tầng suy luận có xu hướng đắt hơn LLM văn bản thông thường vì nó luôn chiếm GPU theo cả hai hướng và nó thường được chọn làm tùy chọn tự lưu trữ khi bạn không muốn lộ dữ liệu nội bộ ra bên ngoài.