vLLM / vLLM
📖 vLLM
Definition (English):
vLLM is a high-throughput LLM serving engine that introduces PagedAttention — managing KV-Cache memory using virtual memory paging concepts. This eliminates memory waste from fragmentation and enables high batch sizes. vLLM supports continuous batching, tensor parallelism, and quantization, achieving state-of-the-art serving throughput for open-source LLMs.
📖 vLLM
Định nghĩa (Tiếng Việt):
vLLM là engine phục vụ LLM thông lượng cao giới thiệu PagedAttention — quản lý bộ nhớ KV-Cache bằng khái niệm paging bộ nhớ ảo. Điều này loại bỏ lãng phí bộ nhớ do phân mảnh và cho phép batch size cao. vLLM hỗ trợ continuous batching, tensor parallelism và lượng tử hóa, đạt thông lượng phục vụ tốt nhất cho LLM mã nguồn mở.
📂 Phân loại: Inference
HỆ SINH THÁI CiCC