Tokenization / Mã hóa Token
📖 Tokenization
Definition (English):
Tokenization is the process of breaking down a text corpus into individual elements called tokens. Tokens can be words, characters, or subwords. This is a fundamental preprocessing step in NLP. Different tokenization strategies include word-level, character-level, and subword-level (BPE, WordPiece, SentencePiece). Tokenization significantly affects model performance and vocabulary size.
📖 Mã hóa Token
Định nghĩa (Tiếng Việt):
Mã hóa Token là quá trình chia nhỏ kho văn bản thành các yếu tố riêng lẻ gọi là token. Token có thể là từ, ký tự hoặc từ con. Đây là bước tiền xử lý cơ bản trong NLP. Các chiến lược mã hóa token khác nhau bao gồm cấp từ, cấp ký tự và cấp từ con (BPE, WordPiece, SentencePiece). Mã hóa token ảnh hưởng đáng kể đến hiệu suất mô hình và kích thước từ vựng.
📂 Phân loại: NLP
HỆ SINH THÁI CiCC