AI có thể xử lý văn bản + hình ảnh + âm thanh + video cùng một lúc. GPT-5 / Claude Opus 4.7 / Gemini đều được hỗ trợ.
Đa phương thức là một tính năng của AI có thể xử lý đồng thời nhiều loại dữ liệu như văn bản + hình ảnh + âm thanh + video. Ví dụ: bạn có thể hỏi "Đây là gì?" trong khi hiển thị hình ảnh, đọc và tóm tắt bản PDF, nghe âm thanh và chép lại và tạo biên bản cuộc họp. Tất cả các LLM chính vào năm 2026 (GPT-5 / Claude Opus 4.7 / Gemini Pro) đều tương thích đa phương thức và đã phát triển từ chatbot văn bản đơn thuần thành trợ lý kinh doanh nói chung. Trong sử dụng thực tế, nó nhanh chóng trở nên phổ biến không chỉ để ''đọc hình ảnh'' mà còn để trích xuất dữ liệu có cấu trúc từ đồ thị, biểu đồ và ảnh chụp màn hình.