Sự sụp đổ mô hình là một hiện tượng trong đó tính đa dạng và độ chính xác của đầu ra của mô hình giảm dần khi nội dung do AI tạo sinh được đào tạo lại nhiều lần.
Sự sụp đổ mô hình là hiện tượng trong đó đầu ra của một mô hình dần dần trở nên đồng nhất và mất đi tính đa dạng cũng như độ chính xác do liên tục học lại bằng cách trộn nội dung do AI tạo sinh với dữ liệu huấn luyện. Người ta đã chỉ ra rằng thông tin bị thiếu trong cơ sở phân phối dữ liệu huấn luyện (các mẫu hiếm và ý kiến thiểu số), và khi mỗi thế hệ trôi qua, đầu ra sẽ hội tụ về đầu ra ``trung bình và khá''. Kể từ năm 2026, một lượng lớn nội dung do AI tạo sinh sẽ được phân phối trên web và ngành này cảnh giác với nguy cơ dữ liệu tổng hợp vô tình bị trộn lẫn vào dữ liệu trước khi học của các mô hình thế hệ tiếp theo. Một cạm bẫy trong hoạt động thực tế là bằng cách tạo ra một lượng lớn tài liệu nội bộ và Câu hỏi thường gặp bằng LLM và sử dụng lại chúng làm tài liệu nghiên cứu lại, cuối cùng bạn có thể làm ô nhiễm dữ liệu tổng hợp của mình. Trong lĩnh vực này, việc quản lý lịch sử dữ liệu ghi lại nguồn dữ liệu học tập và các hoạt động duy trì tỷ lệ dữ liệu chính do con người tạo ra đã được áp dụng rộng rãi. Về mặt chi phí, việc xây dựng một quy trình quản lý lịch sử đòi hỏi phải đầu tư thêm, nhưng so với nguy cơ giảm độ chính xác do mô hình xuống cấp thì đây được coi là một mức giá hợp lý. Khi lựa chọn một công cụ, một tiêu chí thực tế là liệu nguồn dữ liệu đào tạo có được tiết lộ hay không.