Riffusion là mô hình AI chuyển đổi dạng sóng âm thanh thành hình ảnh quang phổ và tạo ra âm nhạc bằng cách áp dụng công nghệ mô hình tạo hình ảnh (mô hình Stable Diffusion).
Riffusion được cho là đã xuất hiện vào cuối năm 2022 như một phương pháp tạo nhạc từ lời nhắc văn bản bằng cách áp dụng Stable Diffusion, một mô hình tạo hình ảnh, để đào tạo về hình ảnh phổ âm thanh. Vì là cơ chế chuyển đổi ngược hình ảnh được tạo thành dạng sóng âm thanh nên nó có đặc điểm là thời gian tạo ngắn và hoạt động nhẹ so với các mẫu tạo nhạc chuyên dụng khác. Mặt khác, trong hoạt động thực tế kể từ năm 2026, người ta nói rằng nó sẽ không phù hợp để tạo ra các bài hát dài hoặc các bài hát có diễn biến phức tạp và sẽ chỉ được sử dụng cho nội dung vòng lặp từ vài giây đến hơn 10 giây hoặc để tạo nền tảng cho BGM. Đối với mục đích sử dụng thương mại, các mối lo ngại trong lĩnh vực này bao gồm rủi ro bản quyền đối với dữ liệu đào tạo và thực tế là quyền của sản phẩm không được tổ chức đầy đủ. Về mặt chi phí, vì đây là triển khai nguồn mở nên bản thân phí sử dụng API có thể được giữ ở mức thấp, nhưng khi kết hợp nó vào hoạt động thực tế, cần phải tính đến thực tế là việc hiệu chỉnh chất lượng âm thanh và xử lý hậu kỳ sẽ yêu cầu thêm giờ công.