Quantization / Lượng tử hóa
📖 Quantization
Definition (English):
Quantization in AI refers to the process of reducing the precision of the numbers used to represent a model's parameters and activations. By converting from 32-bit floating point to 8-bit or even 4-bit integers, quantization dramatically reduces model size and increases inference speed with minimal impact on accuracy. Techniques include post-training quantization (PTQ) and quantization-aware training (QAT). This enables running large models on edge devices.
📖 Lượng tử hóa
Định nghĩa (Tiếng Việt):
Lượng tử hóa trong AI đề cập đến quá trình giảm độ chính xác của các số được sử dụng để biểu diễn tham số và kích hoạt của mô hình. Bằng cách chuyển đổi từ số thực 32-bit sang số nguyên 8-bit hoặc thậm chí 4-bit, lượng tử hóa giảm đáng kể kích thước mô hình và tăng tốc độ suy luận với tác động tối thiểu đến độ chính xác. Các kỹ thuật bao gồm lượng tử hóa sau huấn luyện (PTQ) và huấn luyện nhận thức lượng tử hóa (QAT). Điều này cho phép chạy mô hình lớn trên thiết bị biên.
📂 Phân loại: Practical
HỆ SINH THÁI CiCC