Mô hình ngôn ngữ khuếch tán là LLM thế hệ mới áp dụng quy trình khuếch tán đã được chứng minh trong việc tạo hình ảnh sang tạo văn bản. Thay vì tạo tuần tự từ trái sang phải truyền thống, đầu ra thu được bằng cách khử nhiễu lặp đi lặp lại một chuỗi mã thông báo nhiễu.
Mô hình ngôn ngữ khuếch tán (Diffusion LLM) là một kiến trúc chuyển cơ chế khử nhiễu xác suất của các mô hình khuếch tán như Stable Diffusion sang văn bản. Trong khi các mô hình tự hồi quy như GPT tạo mỗi lần một mã thông báo từ trái sang phải, các chuỗi mã thông báo bị che/bị nhiễu ngẫu nhiên được "làm sạch" liên tục để hội tụ về đầu ra cuối cùng. Về lý thuyết, có thể khử nhiễu song song, do đó, nó được kỳ vọng sẽ có lợi thế về tốc độ suy luận khi tạo ra các câu dài. Kể từ năm 2026, Mercury và MDLM (Mô hình ngôn ngữ khuếch tán mặt nạ) của Inception Labs là đại diện. Có ba cạm bẫy khi tổ chức các trường hợp sử dụng tại chỗ bằng ReviewAI. ① Chất lượng: Độ chính xác của văn bản tiếng Nhật thường không tốt bằng các mô hình tự hồi quy và còn non nớt đối với công việc viết tiếng Nhật. ② Thiếu API: Hầu như không có điểm cuối thương mại và cần phải lưu trữ GPU nội bộ để hoạt động thực tế. ③ Ước tính chi phí: Chi phí suy luận GPU được ước tính là 50-80% so với GPT-4o, nhưng có rất ít băng ghế công cộng và không rõ ràng. Hướng dẫn lựa chọn trong lĩnh vực này: Nếu tiếng Anh là ngôn ngữ chính, việc sử dụng thử nghiệm và tốc độ là ưu tiên hàng đầu của bạn thì rất đáng để thử. Kể từ năm 2026, mô hình tự hồi quy sẽ là lựa chọn duy nhất cho mục đích kinh doanh của Nhật Bản. Ví dụ, có thông tin cho rằng việc hoàn thành mã tiếng Anh nhanh hơn 30% so với trước đây, nhưng khả năng tái tạo vẫn chưa được xác nhận, vì vậy đừng quá tự tin.