JA EN

#chinchilla

1 記事

01 ·LLM — 大規模言語モデル·★ 会員·論文·11分で読めます スケーリング則を1から解説 — なぜ大きくすると賢くなるのか Training Compute-Optimal Large Language Models 「モデルを大きくすれば賢くなる」を数式にしたのがスケーリング則。Kaplan則からChinchilla論文(Hoffmann et al., 2022)への転換を、400本超の実験・3つの推定法・70B対280Bの直接対決まで、論文本文だけを根拠に1から解説する。