CLIP là một mô hình học tương phản, học một lượng lớn các cặp hình ảnh và văn bản rồi nhúng chúng vào cùng một không gian vectơ để xác định mức độ gần gũi về mặt ngữ nghĩa của cả hai.
CLIP là một mô hình học tập tương phản được OpenAI công bố vào năm 2021, xử lý hình ảnh và văn bản trong một không gian nhúng chung và được cho là được áp dụng rộng rãi như một công nghệ cơ bản cho nhiều ứng dụng như tạo hình ảnh, tìm kiếm và phân loại không ảnh. Trong các mô hình khuếch tán như Stable Diffusion và DALL-E, bộ mã hóa văn bản của CLIP diễn giải ý nghĩa của lời nhắc và đóng vai trò hướng dẫn việc tạo hình ảnh. Trong các hoạt động thực tế kể từ năm 2026, CLIP rất có thể sẽ được sử dụng như một phiên bản tích hợp của các công cụ tìm kiếm và tạo hình ảnh hiện có thay vì được sử dụng một mình và việc trả phí hàng tháng cho một công cụ SaaS trong lĩnh vực này sẽ phổ biến hơn là tự mình lưu trữ nó. Những cạm bẫy bao gồm thực tế là có những thành kiến về văn hóa và ngôn ngữ xuất phát từ dữ liệu học tập, ý nghĩa của các lời nhắc tiếng Nhật được cho là yếu hơn so với tiếng Anh và rằng sự tương ứng giữa văn bản và hình ảnh có thể mơ hồ với các hướng dẫn trừu tượng và phức tạp. Khi chọn một công cụ, độ chính xác của việc tìm kiếm và phân loại dựa trên CLIP có liên quan trực tiếp đến trải nghiệm sản phẩm, do đó, nói chung là an toàn khi dùng thử miễn phí với hình ảnh và văn bản gần với dữ liệu kinh doanh, xác nhận xem có đạt được mức độ tương tự mong muốn hay không rồi tiến hành triển khai trên quy mô đầy đủ.