PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#attention
13 記事
01
2026-09-03
·
時系列データ系
·
★ 会員
·
論文
·
18分で読めます
論文解説 H3-World — 言語理解を「世界の操作」に変える
H3-World: Turning Language Understanding into World Control
33Bの動画生成モデルを、専用のアクション機構を足さずに「操作できる世界モデル」へ変える手法。行動を文に変換し、動画潜在の時間区間に結びつけ、注意のルーティングで混線を止める。動かすのは全パラメータの0.199%だけ。
02
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
13分で読めます
長文脈LLMの技術 — RoPE補間からリング注意まで
Extending Context Window of Large Language Models via Positional Interpolation
「コンテキスト長128K」の中身は、性格の違う二つの壁を別々に越えた結果です。位置の壁を越える位置補間・NTK・YaRN、計算の壁を越える窓とリング注意、そして越えられたかを測るneedle試験の読み方を、前提知識ゼロから順に追います。
03
2026-08-27
·
Transformerの仕組み
·
★ 会員
·
論文
·
13分で読めます
FlashAttentionを1から — 計算を増やして速くする逆説
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
FlashAttentionは逆伝播でわざと同じ計算をやり直します。演算回数は増えるのに速い——GPUでは掛け算よりデータの運搬のほうが高いからです。HBMとSRAMの往復を数えるところから、タイリングを阻むsoftmaxの壁、それを壊すオンラインsoftmaxの漸化式、そして現場でバックエンドが静かにフォールバックする落とし穴までを前提知識ゼロから追います。
04
2026-08-26
·
Transformerの仕組み
·
無料
·
論文
·
13分で読めます
Transformer完全解剖 — 埋め込みから出力まで一気通貫
Attention Is All You Need
「今日は」と打ってから「いい天気」が返るまで、たった1つのトークンが何を持たされ、どこで書き換えられ、最後にどうやって言葉に戻るのか。分かち書き・埋め込み・位置・注意・フィードフォワード・残差・出力ヘッドまで、部品を並べるのではなく1本の旅として通しで歩く地図。
05
2026-08-26
·
Transformerの仕組み
·
無料
·
論文
·
13分で読めます
Transformer完全解剖 — 埋め込みから出力まで一気通貫
Attention Is All You Need
「今日は」と打ってから「いい天気」が返るまで、たった1つのトークンが何を持たされ、どこで書き換えられ、最後にどうやって言葉に戻るのか。分かち書き・埋め込み・位置・注意・フィードフォワード・残差・出力ヘッドまで、部品を並べるのではなく1本の旅として通しで歩く地図。
06
2026-08-22
·
Transformerの仕組み
·
★ 会員
·
論文
·
11分で読めます
Attentionの変種図鑑 — MQA・GQA・スライディング窓・線形注意
Fast Transformer Decoding: One Write-Head is All You Need
MQA・GQA・スライディング窓・線形注意は、それぞれ勝手に生まれた別々の工夫ではありません。KVキャッシュの大きさを決める一本の掛け算式があり、変種は「どの項を叩いたか」で分類できます。系譜を式の上に並べ直すと、何を捨てて何を得たのかが一目で見えます。
07
2026-08-22
·
Transformerの仕組み
·
★ 会員
·
論文
·
11分で読めます
Attentionの変種図鑑 — MQA・GQA・スライディング窓・線形注意
Fast Transformer Decoding: One Write-Head is All You Need
MQA・GQA・スライディング窓・線形注意は、それぞれ勝手に生まれた別々の工夫ではありません。KVキャッシュの大きさを決める一本の掛け算式があり、変種は「どの項を叩いたか」で分類できます。系譜を式の上に並べ直すと、何を捨てて何を得たのかが一目で見えます。
08
2026-08-05
·
Transformerの仕組み
·
無料
·
論文
·
13分で読めます
位置エンコーディングを1から理解する(絶対位置からRoPEまで)
Attention Is All You Need
Transformerは素のままでは語順を知らない。なぜ位置情報が要るのかから始めて、sin/cosの絶対位置、学習型、そして現代LLMの標準であるRoPEまでを段階的に解説。「なぜ回転が相対位置を表せるのか」を式で示す。
09
2026-08-05
·
Transformerの仕組み
·
無料
·
論文
·
13分で読めます
位置エンコーディングを1から理解する(絶対位置からRoPEまで)
Attention Is All You Need
Transformerは素のままでは語順を知らない。なぜ位置情報が要るのかから始めて、sin/cosの絶対位置、学習型、そして現代LLMの標準であるRoPEまでを段階的に解説。「なぜ回転が相対位置を表せるのか」を式で示す。
10
2026-08-03
·
論文解説
·
★ 会員
·
論文
·
14分で読めます
論文解説 Attention Is All You Need — 再帰を捨てたモデルは何を証明したのか
Attention Is All You Need
Transformerの原論文を、本文だけを根拠に読み解く。スケーリング付き内積注意の式、なぜルートd_kで割るのか、アブレーションが暴いた設計の急所、そして論文自身が認めた限界まで。
11
2026-08-03
·
論文解説
·
★ 会員
·
論文
·
14分で読めます
論文解説 Attention Is All You Need — 再帰を捨てたモデルは何を証明したのか
Attention Is All You Need
Transformerの原論文を、本文だけを根拠に読み解く。スケーリング付き内積注意の式、なぜルートd_kで割るのか、アブレーションが暴いた設計の急所、そして論文自身が認めた限界まで。
12
2026-07-24
·
Transformerの仕組み
·
無料
·
10分で読めます
Attention機構を1から理解する — Transformerの心臓部を絵解きで
ChatGPTの中核technology「自己注意機構」を、前提知識ゼロから比喩→直感→行列計算→numpyコードの順で解説。数式アレルギーでも読める入門記事。
13
2026-07-24
·
Transformerの仕組み
·
無料
·
10分で読めます
Attention機構を1から理解する — Transformerの心臓部を絵解きで
ChatGPTの中核technology「自己注意機構」を、前提知識ゼロから比喩→直感→行列計算→numpyコードの順で解説。数式アレルギーでも読める入門記事。