PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#scaling
3 記事
01
2026-08-26
·
モデル系統図鑑
·
★ 会員
·
13分で読めます
GPT系譜 — GPT-1から現在までの設計思想
GPT-1からGPT-4o・推論モデルまで、各世代で「何を変え、何を変えなかったのか」を追う。設計の中心にあるのは一貫して『次の一語を当てる』だけの機械で、変わったのは規模・学習の順序・出力の躾け方だった。
02
2026-08-13
·
★ 会員
·
論文
·
13分で読めます
論文解説: マルチモーダル事前学習の『物理法則』— 知識はどのモダリティからどこへ流れるのか
Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes
テキストと画像を最初から1つのモデルで学ばせると何が起きるのか。Meta FAIRらの大規模な統制実験から、知識の非対称な流れ、シナジーが生まれる条件、『視覚の怠け』を防ぐ早期統一、そして生成データ5%で強い画像生成を成立させるレシピまでを読み解く。
03
2026-08-12
·
論文解説
·
★ 会員
·
論文
·
13分で読めます
Mixture of Experts (MoE) を1から解説 — Switch Transformerのルーティングと負荷分散
Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
巨大LLMを支える疎なアーキテクチャ「Mixture of Experts」を、Switch Transformer論文に沿って前提知識ゼロから解説。ルーターの数式、エキスパート容量、負荷分散損失、学習を安定させる3つの工夫まで、一次資料の数値だけで組み立てる。