PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#vllm
3 記事
01
2026-09-07
·
推論・高速化
·
★ 会員
·
論文
·
15分で読めます
論文解説: Random Attention — KVキャッシュの追い出しは「ランダムで十分」だった
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
KVキャッシュから何を捨てるかを決める「重要度スコア」は、ほとんど効いていなかった。プロンプトだけ守って残りをヘッドごとに一様ランダムで捨てるだけで最強手法と同等の精度、しかもvLLMで32〜43%速い。4モデル×6タスクの実測と、なぜそうなるかの2つの対照実験を読み解きます。
02
2026-09-05
·
推論・高速化
·
★ 会員
·
論文
·
13分で読めます
論文解説: Language Models Can Control Their Own Attention — モデルに「どこを見るか」を宣言させる
Language Models Can Control Their Own Attention
長文脈のデコードでは、モデルは毎ステップKVキャッシュを丸ごと読み直している。Declarative Attention は、モデル自身に思考の中で「次はどこを見る」と宣言させ、推論エンジンがその宣言からアテンションマスクを作る。既製モデルにゼロショットで適用して注意トークンを52.0%/31.1%削減した論文を解説する。
03
2026-08-27
·
推論・高速化
·
無料
·
論文
·
13分で読めます
LLMサービングを1から — vLLM・連続バッチングで、GPUを遊ばせない
Efficient Memory Management for Large Language Model Serving with PagedAttention
モデルが動くことと、100人ぶんのリクエストを捌けることは別の問題です。重みも答えも変えず、投げる順番とまとめ方だけで同じGPUの処理量が何倍も変わる——その理屈を演算強度・連続バッチング・PagedAttentionの3点から追い、スループットとレイテンシが同時には良くならない理由と実測値の読み方まで。