JA EN

#latency

1 記事

01 ·推論・高速化·無料·論文·13分で読めます LLMサービングを1から — vLLM・連続バッチングで、GPUを遊ばせない Efficient Memory Management for Large Language Model Serving with PagedAttention モデルが動くことと、100人ぶんのリクエストを捌けることは別の問題です。重みも答えも変えず、投げる順番とまとめ方だけで同じGPUの処理量が何倍も変わる——その理屈を演算強度・連続バッチング・PagedAttentionの3点から追い、スループットとレイテンシが同時には良くならない理由と実測値の読み方まで。