추론 인프라·서빙UC Berkeley
vLLM + PagedAttention 공개
vLLM + PagedAttention 공개
왜 중요한가
KV 캐시를 OS 페이징처럼 관리해 메모리 낭비를 4% 미만으로, 오픈소스 서빙 표준의 출발점
출처 — 1차 출처만 싣고, 직접 이동해 확인할 수 있어요
공식 발표vllm.aihttps://vllm.ai/blog/2023-06-20-vllm2026년 8월 24일에 더한 조각 · 그 주 보기
vLLM + PagedAttention 공개
KV 캐시를 OS 페이징처럼 관리해 메모리 낭비를 4% 미만으로, 오픈소스 서빙 표준의 출발점