JA EN

#scaling

3 記事

01 ·モデル系統図鑑·★ 会員·13分で読めます GPT系譜 — GPT-1から現在までの設計思想 GPT-1からGPT-4o・推論モデルまで、各世代で「何を変え、何を変えなかったのか」を追う。設計の中心にあるのは一貫して『次の一語を当てる』だけの機械で、変わったのは規模・学習の順序・出力の躾け方だった。 02 ·★ 会員·論文·13分で読めます 論文解説: マルチモーダル事前学習の『物理法則』— 知識はどのモダリティからどこへ流れるのか Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes テキストと画像を最初から1つのモデルで学ばせると何が起きるのか。Meta FAIRらの大規模な統制実験から、知識の非対称な流れ、シナジーが生まれる条件、『視覚の怠け』を防ぐ早期統一、そして生成データ5%で強い画像生成を成立させるレシピまでを読み解く。 03 ·論文解説·★ 会員·論文·13分で読めます Mixture of Experts (MoE) を1から解説 — Switch Transformerのルーティングと負荷分散 Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity 巨大LLMを支える疎なアーキテクチャ「Mixture of Experts」を、Switch Transformer論文に沿って前提知識ゼロから解説。ルーターの数式、エキスパート容量、負荷分散損失、学習を安定させる3つの工夫まで、一次資料の数値だけで組み立てる。