JA EN

#batching

2 記事

01 ·推論・高速化·無料·論文·13分で読めます LLMサービングを1から — vLLM・連続バッチングで、GPUを遊ばせない Efficient Memory Management for Large Language Model Serving with PagedAttention モデルが動くことと、100人ぶんのリクエストを捌けることは別の問題です。重みも答えも変えず、投げる順番とまとめ方だけで同じGPUの処理量が何倍も変わる——その理屈を演算強度・連続バッチング・PagedAttentionの3点から追い、スループットとレイテンシが同時には良くならない理由と実測値の読み方まで。 02 ·推論・高速化·★ 会員·13分で読めます 推論コスト削減の実務 — 何から手を付けるか 量子化も蒸留も効きますが、たいていの現場ではその前に「品質を1ミリも賭けずに済む手」が残っています。請求書を4つの数に分解し、キャッシュ→バッチング→短縮→圧縮の順に並べ替える。各手の効き方と、順序を間違えたときに何が壊れるかまで。