PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#scaling-laws
3 記事
01
2026-09-03
·
推論・高速化
·
★ 会員
·
論文
·
16分で読めます
論文解説 SMELT — 「同じ層をもう一周」は、予算を揃えても得なのか
SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
層を積むかわりに同じ層をもう一度通す「ループ型Transformer」を、FLOPs・総パラメータ・KVキャッシュの3予算を揃えてMoEで検証した論文。中央半分を2周するSMELTが学習FLOPsを6.8〜18.0%節約したと報告する。
02
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
12分で読めます
スケーリング懐疑論 — 「大きくするだけ」批判の系譜
Training Compute-Optimal Large Language Models
「パラメータとデータを増やせば賢くなる」への批判を、データ枯渇・推論の壁・世界モデル論争の3方向から公平に整理します。擁護側の証拠も同じ精度で並べ、どの実験結果が出れば論争が決着するのかまで踏み込みます。
03
2026-08-13
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
11分で読めます
スケーリング則を1から解説 — なぜ大きくすると賢くなるのか
Training Compute-Optimal Large Language Models
「モデルを大きくすれば賢くなる」を数式にしたのがスケーリング則。Kaplan則からChinchilla論文(Hoffmann et al., 2022)への転換を、400本超の実験・3つの推定法・70B対280Bの直接対決まで、論文本文だけを根拠に1から解説する。