U-Net là một mạng lưới thần kinh có cấu trúc đối xứng, nén hình ảnh theo từng giai đoạn và sau đó khôi phục nó về độ phân giải ban đầu. Nó đóng vai trò cốt lõi trong quá trình xử lý loại bỏ tiếng ồn cho các mô hình khuếch tán.
U-Net được đề xuất vào năm 2015 để phân đoạn hình ảnh y tế. Đó là mạng sử dụng bộ mã hóa để trích xuất các tính năng đồng thời giảm dần độ phân giải và bộ giải mã để khôi phục độ phân giải gốc, kết nối các lớp tương ứng với các kết nối bỏ qua. Cấu trúc đối xứng này đã được ca ngợi vì khả năng nắm bắt bối cảnh của toàn bộ hình ảnh trong khi vẫn giữ được thông tin vị trí chi tiết và được cho là được sử dụng rộng rãi như một thành phần cốt lõi để lặp lại bước loại bỏ nhiễu trong các mô hình khuếch tán như Stable Diffusion. Trong hoạt động thực tế kể từ năm 2026, việc thay thế bằng kiến trúc dựa trên Biến áp khuếch tán (DiT) sẽ tiến triển, trong khi các mô hình dựa trên U-Net nhẹ có khả năng suy luận với chi phí thấp nên chúng sẽ tiếp tục được sử dụng trong môi trường cục bộ và trong việc cung cấp API định hướng chi phí. Về cách lựa chọn tại hiện trường, việc chọn hệ thống DiT là thực tế nếu bạn ưu tiên chất lượng tạo và quyền tự do ngôn luận, cũng như hệ thống U-Net nếu bạn ưu tiên chi phí suy luận, tốc độ xử lý và khả năng tương thích với các nội dung LoRA hiện có.