GenEval là một tiêu chuẩn đánh giá nhằm đo lường mức độ chính xác mà AI tạo hình ảnh có thể phản ánh các hướng dẫn nhanh chóng (số lượng đối tượng, màu sắc, mối quan hệ vị trí, v.v.) trong hình ảnh.
GenEval là một điểm chuẩn được công bố vào năm 2023 để đo lường khả năng AI tạo văn bản bằng hình ảnh tuân theo hướng dẫn và phương pháp được áp dụng rộng rãi của nó là tự động xác định sự cùng tồn tại của một và nhiều đối tượng, cũng như sự kết hợp giữa số lượng, màu sắc, mối quan hệ vị trí và thuộc tính của hình ảnh được tạo bằng mô hình phát hiện đối tượng và chấm điểm chúng. Việc nó cho phép so sánh có khả năng tái sản xuất cao mà không dựa vào đánh giá chủ quan của con người được cho là lý do tại sao nó thường được trích dẫn trong các báo cáo cải tiến cho các mô hình Hình ảnh và Stable Diffusion. Cạm bẫy trong hoạt động thực tế là ngay cả khi điểm số cao, vẫn có trường hợp nó bị lỗi trong lời nhắc thực tế. Các câu đánh giá chủ yếu là các câu ngắn, cố định và có xu hướng khác với các câu dài và lời nhắc chỉ rõ các điều kiện phức tạp được sử dụng trong hiện trường, do đó, mô hình xếp hạng cao hơn có thể không tối ưu cho mục đích sử dụng của công ty bạn. Ngoài ra, việc đánh giá đòi hỏi chi phí thực hiện quy trình để tạo, phát hiện đối tượng và cho điểm cũng như việc xác minh với số lượng lớn lời nhắc đòi hỏi một lượng thời gian đáng kể. Kể từ năm 2026, thông lệ tiêu chuẩn trong lĩnh vực này là sử dụng điểm GenEval kết hợp với các trục đánh giá khác làm hướng dẫn về tính nhất quán trong giảng dạy và tiến hành các thử nghiệm bổ sung với các gợi ý gần với mục đích sử dụng của công ty trước khi đưa ra lựa chọn. Về mặt tâm lý thị trường, ngày càng có xu hướng xem xét nhiều chỉ số tổng thể, thay vì quyết định chọn một công cụ chỉ dựa trên một điểm chuẩn duy nhất.