JA EN

#vllm

3 記事

01 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説: Random Attention — KVキャッシュの追い出しは「ランダムで十分」だった Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning KVキャッシュから何を捨てるかを決める「重要度スコア」は、ほとんど効いていなかった。プロンプトだけ守って残りをヘッドごとに一様ランダムで捨てるだけで最強手法と同等の精度、しかもvLLMで32〜43%速い。4モデル×6タスクの実測と、なぜそうなるかの2つの対照実験を読み解きます。 02 ·推論・高速化·★ 会員·論文·13分で読めます 論文解説: Language Models Can Control Their Own Attention — モデルに「どこを見るか」を宣言させる Language Models Can Control Their Own Attention 長文脈のデコードでは、モデルは毎ステップKVキャッシュを丸ごと読み直している。Declarative Attention は、モデル自身に思考の中で「次はどこを見る」と宣言させ、推論エンジンがその宣言からアテンションマスクを作る。既製モデルにゼロショットで適用して注意トークンを52.0%/31.1%削減した論文を解説する。 03 ·推論・高速化·無料·論文·13分で読めます LLMサービングを1から — vLLM・連続バッチングで、GPUを遊ばせない Efficient Memory Management for Large Language Model Serving with PagedAttention モデルが動くことと、100人ぶんのリクエストを捌けることは別の問題です。重みも答えも変えず、投げる順番とまとめ方だけで同じGPUの処理量が何倍も変わる——その理屈を演算強度・連続バッチング・PagedAttentionの3点から追い、スループットとレイテンシが同時には良くならない理由と実測値の読み方まで。