Mô hình tự hồi quy là mô hình ngôn ngữ cơ bản dự đoán tuần tự mã thông báo tiếp theo dựa trên chuỗi mã thông báo được tạo cho đến nay và tạo ra các câu từng từ.
Hầu hết các LLM chính như GPT và Claude đều có khả năng tự hồi quy và tiêu chuẩn ngành là phần giải mã của Transformer tính toán phân phối xác suất của mã thông báo tiếp theo theo thứ tự từ đầu câu và tiếp tục xuất mã thông báo được tạo bằng cách thêm chúng vào các điều kiện mỗi lần. Mặc dù nó đã được áp dụng rộng rãi vì nó có độ chính xác cao hơn mô hình không tự hồi quy xuất ra song song toàn bộ câu, nhưng trong hoạt động thực tế, nó chỉ có thể tạo một mã thông báo tại một thời điểm, do đó, nó được coi là một vấn đề trong lĩnh vực mà câu được xuất ra càng dài thì thời gian chờ đợi và chi phí API càng tăng tuyến tính. Kể từ năm 2026, giải mã suy đoán và giải mã song song đã cải thiện tốc độ, nhưng hạn chế cơ bản của việc tạo tuần tự vẫn còn và phí mã thông báo có thể sẽ tăng giá trị đối với các ứng dụng tạo ra số lượng lớn văn bản dài. Trong thực tế, thông lệ tiêu chuẩn là thiết kế các kết quả đầu ra ngắn cho các quy trình yêu cầu hiệu suất thời gian thực hoặc tạo khối lượng lớn và sử dụng các mô hình tự hồi quy ưu tiên cho các nhiệm vụ có thể giảm độ dài đầu ra, chẳng hạn như tóm tắt và phân loại.