Image-Text Matching / Khớp Hình ảnh-Văn bản

✍️
Từ điển và thuật ngữ trí tuệ nhân tạo

📖 Image-Text Matching

Definition (English):

Image-text matching is the task of determining how well an image and a text description correspond to each other. It enables image search by text, text search by image, and cross-modal retrieval. Models like CLIP, BLIP, and ALIGN learn joint embeddings that capture visual-semantic relationships, achieving remarkable zero-shot performance.


📖 Khớp Hình ảnh-Văn bản

Định nghĩa (Tiếng Việt):

Khớp hình ảnh-văn bản là tác vụ xác định mức độ tương ứng giữa hình ảnh và mô tả văn bản. Nó cho phép tìm kiếm hình ảnh bằng văn bản, tìm kiếm văn bản bằng hình ảnh và truy xuất đa phương thức. Các mô hình như CLIP, BLIP và ALIGN học embedding chung nắm bắt mối quan hệ thị giác-ngữ nghĩa, đạt hiệu suất zero-shot đáng chú ý.


📂 Phân loại: Multimodal

HỆ SINH THÁI CiCC

Đi tiếp cùng nội dung này

Hỏi AI Edu?