PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
体系
› AI
LLM — 大規模言語モデル
スケーリング則・プロンプティング・LLMの内部挙動
01
2026-08-13
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
11分で読めます
スケーリング則を1から解説 — なぜ大きくすると賢くなるのか
Training Compute-Optimal Large Language Models
「モデルを大きくすれば賢くなる」を数式にしたのがスケーリング則。Kaplan則からChinchilla論文(Hoffmann et al., 2022)への転換を、400本超の実験・3つの推定法・70B対280Bの直接対決まで、論文本文だけを根拠に1から解説する。
02
2026-08-06
·
LLM — 大規模言語モデル
·
無料
·
論文
·
10分で読めます
プロンプトエンジニアリングの科学 — 何が実証され、何が迷信か
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
「ステップバイステップで考えて」は効くのか。Chain-of-Thought論文(Wei et al., 2022)の本文だけを根拠に、実験で実証されたこと(規模の閾値を超えたモデルでのみ効く創発)と、巷の呪文の多くが未検証であることの線引きをする。
03
2026-09-07
·
LLM — 大規模言語モデル
·
無料
·
論文
·
16分で読めます
Mamba と状態空間モデル(SSM) — 注意機構なしで系列を扱う
Efficiently Modeling Long Sequences with Structured State Spaces
注意機構は「全部を覚えて毎回見返す」方式で、その代償が文長の2乗の計算量です。状態空間モデルは逆に「固定サイズのメモを更新し続ける」方式で、系列長に対して線形に伸びます。連続時間の線形システムから出発し、S4がなぜ畳み込みに化けるのか、Mambaが何を「選択的」にして畳み込みを捨てたのか、そしてどこで注意機構に負けるのかまでを前提知識ゼロから追います。
04
2026-08-26
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
11分で読めます
事前学習データの作り方 — Webから教科書品質へ
The Pile: An 800GB Dataset of Diverse Text for Language Modeling
「大量のWebデータで学習した」の一行の裏には、本文抽出・品質フィルタ・重複除去・混合比という4つの工程がある。CommonCrawlという砂利の山から教科書品質の文章を選り分ける仕組みを、MinHashの式から現場で触るパラメータ名まで1から解説する。
05
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
13分で読めます
LLM評価を1から — ベンチマークの読み方と汚染問題
Measuring Massive Multitask Language Understanding
モデル発表資料に並ぶベンチマークの棒グラフを、正しく疑いながら読むための記事。採点方式がMMLUのスコアを動かす仕組み、問題数から来る誤差の幅、公開ベンチマークが構造的に汚染される理由、Chatbot ArenaのBradley-Terryモデルとその弱点、LLM-as-a-judgeの三つの偏りまでを1から扱う。
06
2026-08-27
·
LLM — 大規模言語モデル
·
無料
·
論文
·
11分で読めます
ハルシネーションはなぜ起きる — 仕組みと現実的な対策
Survey of Hallucination in Natural Language Generation
LLMが平然と嘘をつくのはバグではなく、次トークン予測という学習目的の素直な帰結。損失関数に真偽の項がないこと、圧縮された知識が端から崩れること、サンプリングが裾を引くこと、採点方法が当てずっぽうに報酬を与えることを1から分解し、RAG・引用照合・不確実性推定という現場で実際に効く順に対策を並べる。
07
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
17分で読めます
推論時スケーリング — 「長く考える」モデルの原理
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
同じモデルでも長く考えさせると正答率が上がる。その原理を、途中式を書くCoT、何度も解いて多数決する自己一貫性、候補を選ぶ検証器、思考の長さ自体を強化学習で獲得したo1系まで1から解く。計算の置き場所が学習から推論へ移るとは何を意味するのか。
08
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
13分で読めます
知識蒸留を1から — 大きなモデルを小さく写す
Distilling the Knowledge in a Neural Network
正解ラベルには「犬と猫は似ている」と書かれていません。でも訓練済みモデルの出力にはそれが入っている — この差が知識蒸留の全部です。ソフトラベルと温度つきsoftmax、T²の由来、系列レベル蒸留、合成データ蒸留、そしてDeepSeek-R1が推論の手続きごと小さいモデルへ写した話まで、前提知識ゼロから。
09
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
10分で読めます
アライメント概説 — RLHFからConstitutional AIまで
Training language models to follow instructions with human feedback
アライメントとは何と何を揃える作業なのかを、目的・仕様・代理の3層に分けて整理する。RLHFもDPOもConstitutional AIも「報酬 − 参照モデルから離れた罰」という同じ骨格を解いていること、代理を押し切ると必ず報酬ハッキングが出ること、無害さを強めた分だけ有用さが削れる取引の構造を、式と実装の落とし穴まで含めて解説する。
10
2026-08-27
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
12分で読めます
スケーリング懐疑論 — 「大きくするだけ」批判の系譜
Training Compute-Optimal Large Language Models
「パラメータとデータを増やせば賢くなる」への批判を、データ枯渇・推論の壁・世界モデル論争の3方向から公平に整理します。擁護側の証拠も同じ精度で並べ、どの実験結果が出れば論争が決着するのかまで踏み込みます。
11
2026-08-20
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
10分で読めます
論文解説: 危機映像のAI捏造は見抜けるか — RA-Benchが暴いた検出器の実力
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination
実在の災害・戦争映像の1コマ目から作らせたAI動画1万6千本で、検出器7種・ゼロショットのマルチモーダルモデル10種・専用ファインチューン2種を測ったら、どれも生成元をまたいで汎化しなかった。映像ではなくタイムスタンプを読んでいたモデル、SNS加工で検出率が1.4%まで落ちる話まで、論文本文から解説。
12
2026-08-21
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
16分で読めます
論文解説: SA-MRPO — 満点の科目を勉強し続けるな。飽和した報酬から勾配を引きはがす
Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization
報酬を複数使うRL学習では、すでに満点に近い目的にも勾配予算が配られ続ける。SA-MRPO (arXiv:2608.16072) は目的ごとの「飽和率」を測って重みを割り引き、伸びしろの残る目的へ最適化の力を回す。論文本文だけを根拠に、仕組みと限界を解説する。
13
2026-09-01
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
13分で読めます
論文解説: Agentic Artifact Creation — 「生成」と「納品物を組み立てる」はどう違うのか
Agentic Artifact Creation: Systems, Evaluation, Principles, and Opportunities
259件の文献を「納品される成果物」という一点から整理したサーベイ。状態・編集・検証という3つの役でエージェント的創出を定義し、6ファミリー・評価の3対象・4原則・6つの未解決問題まで、前提知識ゼロから読み解きます。
14
2026-09-03
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
15分で読めます
論文解説: Puro-2B — コンシューマGPUで2Bモデルを$6.9Kからゼロ事前学習する
Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
ゲーミング向けGPUのRTX 5090で1.4兆トークンの事前学習を回し、Qwen2-1.5B級の性能に約$4.4Kで届いたという報告を、コスト構造・FP8・実効学習率・カリキュラム平均の順に1から解説する。