Tokenization / Mã hóa Token

✍️
Từ điển và thuật ngữ trí tuệ nhân tạo

📖 Tokenization

Definition (English):

Tokenization is the process of breaking down a text corpus into individual elements called tokens. Tokens can be words, characters, or subwords. This is a fundamental preprocessing step in NLP. Different tokenization strategies include word-level, character-level, and subword-level (BPE, WordPiece, SentencePiece). Tokenization significantly affects model performance and vocabulary size.


📖 Mã hóa Token

Định nghĩa (Tiếng Việt):

Mã hóa Token là quá trình chia nhỏ kho văn bản thành các yếu tố riêng lẻ gọi là token. Token có thể là từ, ký tự hoặc từ con. Đây là bước tiền xử lý cơ bản trong NLP. Các chiến lược mã hóa token khác nhau bao gồm cấp từ, cấp ký tự và cấp từ con (BPE, WordPiece, SentencePiece). Mã hóa token ảnh hưởng đáng kể đến hiệu suất mô hình và kích thước từ vựng.


📂 Phân loại: NLP

HỆ SINH THÁI CiCC

Đi tiếp cùng nội dung này

Hỏi AI Edu?