vLLM / vLLM

✍️
Từ điển và thuật ngữ trí tuệ nhân tạo

📖 vLLM

Definition (English):

vLLM is a high-throughput LLM serving engine that introduces PagedAttention — managing KV-Cache memory using virtual memory paging concepts. This eliminates memory waste from fragmentation and enables high batch sizes. vLLM supports continuous batching, tensor parallelism, and quantization, achieving state-of-the-art serving throughput for open-source LLMs.


📖 vLLM

Định nghĩa (Tiếng Việt):

vLLM là engine phục vụ LLM thông lượng cao giới thiệu PagedAttention — quản lý bộ nhớ KV-Cache bằng khái niệm paging bộ nhớ ảo. Điều này loại bỏ lãng phí bộ nhớ do phân mảnh và cho phép batch size cao. vLLM hỗ trợ continuous batching, tensor parallelism và lượng tử hóa, đạt thông lượng phục vụ tốt nhất cho LLM mã nguồn mở.


📂 Phân loại: Inference

HỆ SINH THÁI CiCC

Đi tiếp cùng nội dung này

Hỏi AI Edu?