Grouped Query Attention (GQA) / Attention Truy vấn Nhóm
📖 Grouped Query Attention (GQA)
Definition (English):
GQA is an attention variant where multiple query heads share a single set of key-value heads, reducing the KV-cache size during inference. It sits between Multi-Head Attention (MHA, each query has unique KV) and Multi-Query Attention (MQA, all queries share one KV). GQA (8 query heads per KV head) offers a good balance of quality and efficiency, used in LLaMA 2/3 and Mistral.
📖 Attention Truy vấn Nhóm
Định nghĩa (Tiếng Việt):
GQA là biến thể attention trong đó nhiều query heads chia sẻ một tập key-value heads, giảm kích thước KV-cache trong suy luận. Nó nằm giữa Multi-Head Attention (MHA, mỗi query có KV riêng) và Multi-Query Attention (MQA, tất cả query chia sẻ một KV). GVA (8 query heads mỗi KV head) cân bằng tốt chất lượng và hiệu quả, được sử dụng trong LLaMA 2/3 và Mistral.
📂 Phân loại: DL Techniques