DiT (Biến áp khuếch tán) là kiến trúc mô hình khuếch tán sử dụng Transformer thay vì U-Net trong cấu trúc bên trong của mô hình tạo hình ảnh/video.
DiT được thiết kế để sử dụng Máy biến áp nhằm loại bỏ nhiễu khỏi mô hình khuếch tán và được cho là được áp dụng rộng rãi làm cơ sở cho các mô hình tạo hình ảnh và video chất lượng cao như dòng Sora và Stable Diffusion 3 của OpenAI. So với mô hình khuếch tán loại U-Net thông thường, nó có đặc điểm là khả năng tương thích tốt hơn với dữ liệu quy mô lớn và khả năng dễ dàng tăng hiệu suất theo quy luật chia tỷ lệ. Mặt khác, trong hoạt động thực tế vào năm 2026, chi phí tính toán cần thiết cho việc học và suy luận có thể sẽ cao hơn so với loại U-Net và các vấn đề trong lĩnh vực này bao gồm thực tế là thời gian suy luận và chi phí GPU có thể sẽ tăng khi tạo video dài, độ phân giải cao. Khi sử dụng mô hình dựa trên DiT thông qua API, nhìn chung sẽ có hóa đơn trả theo mức sử dụng dựa trên số giây được tạo hoặc số lượng hình ảnh được hiển thị và mặc dù các bản xem trước ngắn có giá rẻ nhưng chi phí có xu hướng tăng mạnh khi xuất sang chất lượng sản xuất. Khi lựa chọn một công cụ, việc so sánh tính nhất quán, khả năng kiểm soát và cấu trúc phí của sản phẩm thực tế được coi là thực tế hơn so với kiến trúc cũ hay mới.