Ảo giác đa phương thức (ảo giác đối tượng) là hiện tượng trong đó mô hình AI xử lý hình ảnh và video bao gồm các đối tượng và thuộc tính không thực sự tồn tại ở đầu ra.
Ảo giác đa phương thức (ảo giác đối tượng) là một hiện tượng trong đó LLM đa phương thức xử lý hình ảnh, video và âm thanh bao gồm các đối tượng, thuộc tính và mối quan hệ trong câu đầu ra không thực sự tồn tại trong đầu vào và được gọi là ảo giác để phân biệt chúng với ảo giác chỉ có văn bản. Nguyên nhân được cho là do kiến thức ngôn ngữ trước đây của LLM về “sự kết hợp chung của các đối tượng” có xu hướng được ưu tiên hơn số lượng tính năng của bộ mã hóa hình ảnh. Trong hoạt động thực tế kể từ năm 2026, việc tạo chú thích hình ảnh, OCR, phân tích camera giám sát và tự động tạo mô tả sản phẩm thương mại điện tử có thể dẫn đến mô tả không chính xác về biểu tượng thương hiệu không được hiển thị hoặc nhận dạng sai về số lượng và màu sắc, do đó, người ta áp dụng rộng rãi rằng các kết quả được tạo ra không được tiết lộ nguyên trạng mà được xem xét thủ công tại hiện trường. Các biện pháp đối phó bao gồm kiểm tra thực tế bằng RAG, kiểm tra chéo với nhiều mô hình và prompt làm rõ bằng chứng (hộp giới hạn, v.v.). Cần phải chọn một mô hình dựa trên chi phí nhân công liên quan đến việc xử lý các kết quả dương tính giả và chi phí liên quan đến quá trình xem xét, đồng thời trong nhiều trường hợp, phạm vi áp dụng được thu hẹp bằng cách xem xét sự cân bằng giữa độ chính xác và chi phí.