JA EN

#scaling-laws

3 記事

01 ·推論・高速化·★ 会員·論文·16分で読めます 論文解説 SMELT — 「同じ層をもう一周」は、予算を揃えても得なのか SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers 層を積むかわりに同じ層をもう一度通す「ループ型Transformer」を、FLOPs・総パラメータ・KVキャッシュの3予算を揃えてMoEで検証した論文。中央半分を2周するSMELTが学習FLOPsを6.8〜18.0%節約したと報告する。 02 ·LLM — 大規模言語モデル·★ 会員·論文·12分で読めます スケーリング懐疑論 — 「大きくするだけ」批判の系譜 Training Compute-Optimal Large Language Models 「パラメータとデータを増やせば賢くなる」への批判を、データ枯渇・推論の壁・世界モデル論争の3方向から公平に整理します。擁護側の証拠も同じ精度で並べ、どの実験結果が出れば論争が決着するのかまで踏み込みます。 03 ·LLM — 大規模言語モデル·★ 会員·論文·11分で読めます スケーリング則を1から解説 — なぜ大きくすると賢くなるのか Training Compute-Optimal Large Language Models 「モデルを大きくすれば賢くなる」を数式にしたのがスケーリング則。Kaplan則からChinchilla論文(Hoffmann et al., 2022)への転換を、400本超の実験・3つの推定法・70B対280Bの直接対決まで、論文本文だけを根拠に1から解説する。