JA EN

#efficiency

3 記事

01 ·Transformerの仕組み·★ 会員·論文·11分で読めます Attentionの変種図鑑 — MQA・GQA・スライディング窓・線形注意 Fast Transformer Decoding: One Write-Head is All You Need MQA・GQA・スライディング窓・線形注意は、それぞれ勝手に生まれた別々の工夫ではありません。KVキャッシュの大きさを決める一本の掛け算式があり、変種は「どの項を叩いたか」で分類できます。系譜を式の上に並べ直すと、何を捨てて何を得たのかが一目で見えます。 02 ·CNN・画像認識·★ 会員·論文·10分で読めます 論文解説: TurboVLA — LLMを追い出したロボット方策が、RTX 4090・VRAM 1GB未満で32Hzを叩き出す TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM 「画像→LLM→行動」が常識だったVLAから大規模言語モデルを外し、視覚と指示文を軽量クロスアテンションで直結。0.2Bパラメータ・31.2ms・0.9GB VRAMでLIBERO 97.7%を達成した設計を、論文本文に沿って1から解説する。 03 ·推論・高速化·★ 会員·論文·11分で読めます 投機的デコーディングを1から解説 — 小さな下書きモデルで、出力を一切変えずにLLMを速くする Fast Inference from Transformers via Speculative Decoding 小型モデルに数トークン先まで下書きさせ、大型モデルが一括検証する「投機的デコーディング」。出力分布を数学的に変えないまま2〜3倍速くなる仕組みを、採択率αの直感とともに原論文から解説する。