PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#efficiency
3 記事
01
2026-08-22
·
Transformerの仕組み
·
★ 会員
·
論文
·
11分で読めます
Attentionの変種図鑑 — MQA・GQA・スライディング窓・線形注意
Fast Transformer Decoding: One Write-Head is All You Need
MQA・GQA・スライディング窓・線形注意は、それぞれ勝手に生まれた別々の工夫ではありません。KVキャッシュの大きさを決める一本の掛け算式があり、変種は「どの項を叩いたか」で分類できます。系譜を式の上に並べ直すと、何を捨てて何を得たのかが一目で見えます。
02
2026-08-13
·
CNN・画像認識
·
★ 会員
·
論文
·
10分で読めます
論文解説: TurboVLA — LLMを追い出したロボット方策が、RTX 4090・VRAM 1GB未満で32Hzを叩き出す
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
「画像→LLM→行動」が常識だったVLAから大規模言語モデルを外し、視覚と指示文を軽量クロスアテンションで直結。0.2Bパラメータ・31.2ms・0.9GB VRAMでLIBERO 97.7%を達成した設計を、論文本文に沿って1から解説する。
03
2026-08-12
·
推論・高速化
·
★ 会員
·
論文
·
11分で読めます
投機的デコーディングを1から解説 — 小さな下書きモデルで、出力を一切変えずにLLMを速くする
Fast Inference from Transformers via Speculative Decoding
小型モデルに数トークン先まで下書きさせ、大型モデルが一括検証する「投機的デコーディング」。出力分布を数学的に変えないまま2〜3倍速くなる仕組みを、採択率αの直感とともに原論文から解説する。