Video thị sai (thế hệ 2.5D) là phương pháp tạo video ước tính thông tin độ sâu từ một hình ảnh tĩnh duy nhất và tách nền trước và nền sau để làm cho nó trông như thể máy ảnh đang chuyển động.
Video thị sai (thế hệ 2.5D) là phương pháp tạo video sử dụng mô hình ước tính độ sâu để chia một hình ảnh tĩnh thành các lớp nền trước, nền giữa và nền sau, sau đó di chuyển máy ảnh trong khi dịch chuyển từng lớp để tạo hiệu ứng chiều sâu mô phỏng. Nó được biết đến rộng rãi dưới dạng biểu thức ``2.5D'' sử dụng hiệu ứng thị sai. Nó phổ biến vì nó có thể tạo ra cảm giác về chiều sâu với chi phí thấp hơn so với hình ảnh 2D đơn giản và được cho là được sử dụng rộng rãi để chuyển đổi hình ảnh tĩnh thành video cho SNS và video ngắn về sách ảnh, bất động sản và tài liệu tham quan. Mặt khác, trong hoạt động thực tế kể từ năm 2026, các vấn đề thường được chỉ ra tại hiện trường, chẳng hạn như hình ảnh có ranh giới giữa chủ thể và hậu cảnh không rõ ràng, ước tính độ sâu không chính xác đối với các đối tượng dạng tóc hoặc dạng lưới, và các đường nối lớp có khả năng bị đứt. Về mặt chi phí, chi phí tạo ra mỗi hình ảnh được cho là rẻ hơn so với việc tạo hình ảnh thông thường, nhưng có thể dễ dàng chọn hình ảnh gốc và tạo lại nó để tránh phá sản và có thể mất nhiều giờ công hơn dự kiến. Về cách chọn tại chỗ, việc chuẩn bị hình ảnh có ranh giới rõ ràng và bố cục đơn giản là thực tế, đồng thời sử dụng video thị sai cho các cảnh SNS ngắn và tạo 3D đầy đủ hoặc quay hành động trực tiếp cho các cảnh dài yêu cầu máy quay hoạt động tự nhiên.