Image-Text Matching / Khớp Hình ảnh-Văn bản
📖 Image-Text Matching
Definition (English):
Image-text matching is the task of determining how well an image and a text description correspond to each other. It enables image search by text, text search by image, and cross-modal retrieval. Models like CLIP, BLIP, and ALIGN learn joint embeddings that capture visual-semantic relationships, achieving remarkable zero-shot performance.
📖 Khớp Hình ảnh-Văn bản
Định nghĩa (Tiếng Việt):
Khớp hình ảnh-văn bản là tác vụ xác định mức độ tương ứng giữa hình ảnh và mô tả văn bản. Nó cho phép tìm kiếm hình ảnh bằng văn bản, tìm kiếm văn bản bằng hình ảnh và truy xuất đa phương thức. Các mô hình như CLIP, BLIP và ALIGN học embedding chung nắm bắt mối quan hệ thị giác-ngữ nghĩa, đạt hiệu suất zero-shot đáng chú ý.
📂 Phân loại: Multimodal
HỆ SINH THÁI CiCC