Heron-Bench là điểm chuẩn đánh giá khả năng hiểu hình ảnh bằng tiếng Nhật của VLM (Mô hình ngôn ngữ trực quan) bằng cách sử dụng các hình ảnh bao gồm văn hóa và tình huống Nhật Bản.
Heron-Bench là phiên bản tiếng Nhật của tiêu chuẩn đánh giá VLM (Mô hình ngôn ngữ hình ảnh) do Turing Inc. phát triển và được đặc trưng bằng cách chấm điểm khả năng hiểu hình ảnh của mô hình bằng phương pháp LLM-as-a-thẩm phán, thông qua các câu trả lời hỏi đáp cho các hình ảnh bao gồm phong cảnh, dấu hiệu và văn hóa lối sống Nhật Bản. Nó đã được ca ngợi vì khả năng hình dung thực tế rằng ngay cả những mẫu đạt điểm chuẩn VQA chủ yếu được sử dụng ở các quốc gia nói tiếng Anh cũng có thể có độ chính xác thấp hơn khi nói đến hình ảnh mô tả các biển báo hoặc thói quen lối sống đặc trưng của Nhật Bản. Trong hoạt động thực tế kể từ năm 2026, điểm số có thể dao động tùy thuộc vào hiệu suất của chính LLM được sử dụng để chấm điểm và thiết kế lời nhắc, đồng thời việc kiểm soát phiên bản và cố định của các mô hình kiểm tra sẽ rất cần thiết để so sánh theo chiều ngang giữa các mô hình. Đối với phương pháp lựa chọn trong lĩnh vực này, nó được áp dụng rộng rãi không chỉ sử dụng điểm độc lập mà còn sử dụng sự khác biệt với điểm chuẩn tiếng Anh để xác định xem có cần thiết phải điều chỉnh chuyên ngành cho tiếng Nhật hay không. Việc chấm điểm bằng cách sử dụng API thương mại sẽ làm tăng chi phí tùy thuộc vào số lượng yêu cầu, do đó, việc sử dụng một số lượng mẫu hạn chế sau khi hiểu rõ điều kiện thị trường được coi là thực tế.