ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

Video-MME (Biên tập hiểu video)

Video-MME là điểm chuẩn đo lường khả năng hiểu video của các mô hình AI đa phương thức bằng cách sử dụng nhiều video ngắn đến dài và bộ câu trả lời câu hỏi.

Video-MME là điểm chuẩn hiểu video bao gồm các phương pháp hỏi đáp đa phương thức kết hợp phụ đề, âm thanh và khung hình video cho các video từ các clip ngắn vài chục giây đến video dài hơn một giờ và được cho là được sử dụng rộng rãi để so sánh song song độ chính xác hiểu video của các LLM đa phương thức chính như GPT-4o, Gemini và Qwen-VL. Tuy nhiên, trong hoạt động thực tế kể từ năm 2026, người ta đã chỉ ra rằng ngay cả những mẫu máy có điểm chuẩn cao cũng có nguy cơ bị bỏ lỡ những cảnh quan trọng do lấy mẫu khung hình thô khi xem video dài và độ chính xác tóm tắt cũng như độ chính xác tìm kiếm trong trường sẽ không cải thiện nhiều bằng điểm số. Ngoài ra, số lượng mã thông báo cần thiết để trích xuất khung, sao chép âm thanh và suy luận trên mỗi video có xu hướng lớn hơn nhiều so với số lượng cho một hình ảnh hoặc đầu vào văn bản ngắn và về mặt chi phí, nó được cho là đắt hơn từ vài lần đến vài chục lần. Do đó, khi chọn mô hình hiểu video tại hiện trường, bạn không chỉ nên sử dụng xếp hạng điểm chuẩn mà còn tiến hành xác minh đo lường thực tế bằng cách sử dụng dữ liệu nội bộ trong các điều kiện gần với độ dài và tốc độ khung hình của video sẽ thực sự được sử dụng.

Thuật ngữ liên quan