Vision Transformer (ViT) / Transformer Thị giác

✍️

📖 Vision Transformer (ViT)

Definition (English):

Vision Transformer (ViT) is a transformer-based model adapted for image classification. Instead of processing images with convolutions, ViT splits images into fixed-size patches, linearly embeds them, and processes them as a sequence of tokens. ViT has achieved state-of-the-art results on image classification benchmarks, demonstrating that transformers can rival CNNs in computer vision.


📖 Transformer Thị giác

Định nghĩa (Tiếng Việt):

Transformer Thị giác (ViT) là mô hình dựa trên transformer được điều chỉnh cho phân loại hình ảnh. Thay vì xử lý hình ảnh bằng tích chập, ViT chia hình ảnh thành các mảnh kích thước cố định, nhúng chúng tuyến tính và xử lý chúng dưới dạng chuỗi token. ViT đã đạt kết quả tốt nhất trên các benchmark phân loại hình ảnh, chứng minh transformer có thể cạnh tranh với CNN trong thị giác máy tính.


📂 Phân loại: Models

Hỏi AI Edu?