Tạo video tự động hồi quy là phương pháp dự đoán tuần tự khung hình tiếp theo dựa trên khung hình được tạo trước đó và tạo video tuần tự ngay từ đầu.
Tạo video tự động hồi quy là phương pháp trong đó video được tạo tuần tự từng khung hình (hoặc nhóm khung hình) dọc theo trục thời gian, giống như cách mô hình ngôn ngữ dự đoán từ tiếp theo. Trong khi mô hình khuếch tán thông thường tạo ra toàn bộ video bằng cách loại bỏ nhiễu cùng một lúc, thì mô hình tự hồi quy dự đoán các khung hình trong tương lai dựa trên kết quả của thế hệ trước, do đó về mặt lý thuyết, nó phù hợp để tạo video theo thời gian thực giống như phát trực tuyến và tạo video có độ dài thay đổi. Mặt khác, trong hoạt động thực tế kể từ năm 2026, các lỗi đã tích lũy với từng khung hình và vấn đề đã được chỉ ra là "tích lũy lỗi", trong đó chất lượng và tính nhất quán của hình ảnh có nhiều khả năng xấu đi khi khung hình dài hơn và việc kiểm tra chất lượng sẽ tốn nhiều công sức hơn nếu hình ảnh được tạo ra trong hơn vài chục giây. Ngoài ra, do tính chất của việc tạo tuần tự, rất khó để dự đoán chi phí GPU và giá thị trường trong quá trình suy luận so với các mô hình khuếch tán, do đó, trong thực tế, người ta thường sử dụng mô hình tự hồi quy cho các ứng dụng có thời lượng ngắn và độ trễ thấp, đồng thời sử dụng các công cụ mô hình khuếch tán cho các ứng dụng có thời lượng dài và chất lượng cao.