用語集 › pagedattention
GLOSSARY
pagedattention
OSのページングを模したKVキャッシュ管理方式
2本の論文題名に登場
定義
OS の仮想メモリのページングを模して、KV キャッシュを固定サイズのブロック単位で管理する手法。連続領域を確保する必要がなくなるため断片化と過剰確保が減り、同じ GPU でより多くのリクエストを同時に処理できる。推論エンジン vLLM の中核技術として知られる。
論文題名での読み方
固有名。vLLMの中核技術
この語が出てくる解説
- LLMサービングを1から — vLLM・連続バッチングで、GPUを遊ばせないEfficient Memory Management for Large Language Model Serving with PagedAttention