Điểm CLIP là chỉ số đánh giá nhằm định lượng mức độ khớp ngữ nghĩa giữa hình ảnh được tạo và mô tả văn bản.
Điểm CLIP là chỉ số đánh giá tính toán các vectơ nhúng của mô hình CLIP của OpenAI bằng cách sử dụng bộ mã hóa hình ảnh và bộ mã hóa văn bản, đồng thời định lượng tính nhất quán ngữ nghĩa của hình ảnh và lời nhắc bằng cách sử dụng độ tương tự cosine. Nó được áp dụng rộng rãi như một phương pháp đánh giá tự động tiêu chuẩn ngành cho các điểm chuẩn AI tạo hình ảnh và có ưu điểm là chi phí thấp hơn và có khả năng tái sản xuất cao hơn so với đánh giá thủ công. Mặt khác, trong quá trình vận hành thực tế vào năm 2026, những cạm bẫy đã được chỉ ra, chẳng hạn như không thể phát hiện các sai sót về bố cục hoặc kết cấu, và ngay cả khi điểm cao, các sắc thái nhỏ của lời nhắc tiếng Nhật (số lượng người, quần áo, đặc điểm lý lịch, v.v.) có thể bị bỏ sót. Trong lĩnh vực này, thông lệ là không đánh giá đạt/không chỉ dựa trên điểm CLIP mà sử dụng nó kết hợp với các chỉ báo khác như FID và kiểm tra trực quan, và nói chung, nếu bạn sử dụng triển khai nguồn mở, sẽ hầu như không có chi phí bổ sung.