Trí thông minh không gian là khả năng AI hiểu được độ sâu, vị trí và mối quan hệ vật lý của các vật thể dưới dạng 3D từ hình ảnh và video 2D, đồng thời dự đoán chuyển động và thay đổi.
Trí thông minh không gian đề cập đến khả năng AI tổng hợp suy ra mối quan hệ về độ sâu, kích thước và vị trí giữa các vật thể, cũng như các quy luật vật lý như trọng lực và va chạm, từ dữ liệu hình ảnh và video phẳng cũng như dự đoán và tạo ra các thay đổi trên trục thời gian. Trong khi các mô hình tạo video thông thường ưu tiên "tính hợp lý rõ ràng", các mô hình được trang bị trí thông minh không gian được xác định là tiêu chuẩn ngành ở chỗ chúng nhấn mạnh tính nhất quán của đối tượng (các mối quan hệ hình dạng và vị trí không bị thu gọn ngay cả trên các khung hình). Trong hoạt động thực tế kể từ năm 2026, cái gọi là sự không nhất quán về không gian-thời gian, trong đó vị trí của nền và các vật thể nhỏ có thể hơi dịch chuyển từ khung này sang khung khác trong các video dài, nhiều đoạn, vẫn có khả năng xảy ra và thực tế là không thể bỏ qua quá trình kiểm tra hình ảnh sau khi tạo tại hiện trường. Về mặt chi phí, các mô hình hỗ trợ trí tuệ không gian có tải tính toán cao hơn so với việc tạo video thông thường và cả đơn giá tạo cũng như thời gian xử lý đều có xu hướng đắt. Do đó, phương pháp lựa chọn trong lĩnh vực này ngày càng trở nên giống “một mô hình nhẹ nhàng cho những đoạn quảng cáo ngắn và một mô hình hỗ trợ trí tuệ không gian để giới thiệu sản phẩm dài” sau khi hiểu được điều kiện thị trường.