PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#fine-tuning
13 記事
01
2026-09-06
·
RAG・検索拡張
·
無料
·
10分で読めます
RAG vs ファインチューニング — どちらを、いつ選ぶか
LLMを賢くする二大手法を、知識の鮮度・コスト・幻覚・データ量の4軸で比べる。比喩→仕組み(式)→動く図→判断表→現場の落とし穴まで、前提知識ゼロから。
02
2026-09-04
·
学習手法・アライメント
·
★ 会員
·
論文
·
19分で読めます
論文解説: It Takes Two to Match — 検索の「両側」をRLで共進化させるCoGR
It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning
検索の一段目を、クエリ側とアイテム側の2つのLLMに「キーワードを書かせる」ことで作り直す論文。両者を強化学習で交互に鍛えて語彙を歩み寄らせるCoGRを、前提知識ゼロから解説する。
03
2026-09-03
·
学習手法・アライメント
·
★ 会員
·
論文
·
18分で読めます
論文解説: StudentSim — 「その生徒そのもの」を訓練で作る学習者シミュレータ
StudentSim: Training LLM-based Student Simulators
AI家庭教師を鍛えるための『練習台になる生徒』を、実際の学習記録から訓練して作る枠組み。行動忠実度(F)と指導反応性(R)という2軸の定義から、プール学習→生徒別特化の2段パイプライン、報酬モデルとしての応用までを1から解説する。
04
2026-09-03
·
学習手法・アライメント
·
★ 会員
·
論文
·
18分で読めます
論文解説: StudentSim — 「その生徒そのもの」を訓練で作る学習者シミュレータ
StudentSim: Training LLM-based Student Simulators
AI家庭教師を鍛えるための『練習台になる生徒』を、実際の学習記録から訓練して作る枠組み。行動忠実度(F)と指導反応性(R)という2軸の定義から、プール学習→生徒別特化の2段パイプライン、報酬モデルとしての応用までを1から解説する。
05
2026-09-02
·
学習手法・アライメント
·
★ 会員
·
論文
·
15分で読めます
論文解説: PaperGym — 論文1本を「採点基準つきの練習場」に変えて研究計画を学習させる
PaperGym: Rubric-Centered Evolution for Research-Plan Generation
研究計画には正解がないので強化学習の「環境」が作れない。論文を4つの引き出しに分解し、問いと採点基準を別々の引き出しから作ることで、言い換えでは点が取れない練習場を20,000本ぶん自動生成した研究を、前提知識ゼロから解説する。
06
2026-08-30
·
学習手法・アライメント
·
★ 会員
·
論文
·
12分で読めます
論文解説 PAWBench — 動画生成は「起こりうる未来の確率」まで当てられるのか
PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
動画生成モデルを世界モデルと呼ぶなら、もっともらしい1本ではなく、同じ初期状態から繰り返し生成したときの分布が正しくなければならない。PAWBench はその確率的整合を50シナリオ・11モデルで測り、どのモデルも要件を揃えられないことを示した論文です。
07
2026-08-27
·
学習手法・アライメント
·
★ 会員
·
論文
·
11分で読めます
継続学習と破滅的忘却 — 学び続けるモデルの難しさ
Overcoming catastrophic forgetting in neural networks
追加学習させると前にできていたことが崩れる「破滅的忘却」を、重みが共有資源であるという一点から説明する。EWC・リプレイ・LoRA差し替えという3つの処方を式と動く図で追い、それでも実務が「昔のデータを混ぜて学習し直す」に落ち着く理由までを前提知識なしで解説。
08
2026-08-22
·
推論・高速化
·
★ 会員
·
論文
·
23分で読めます
論文解説: Agentic ESOpt — 逆伝播をやめて「モデルを揺らす」だけで、長丁場のLLMエージェントを鍛える
Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements
勾配を一切計算せず、パラメータにノイズを足した分身をG体走らせて良かった方向へ寄せるだけ——推論と同じGPUメモリ(8.41GB)で27Bの全パラメータを更新し、15手必要な数独でGRPOに12.50ポイント差をつけたNUSらの論文を、1から解説する。
09
2026-08-13
·
学習手法・アライメント
·
★ 会員
·
論文
·
14分で読めます
論文解説: ABSeeker — 答えから逆算して「良い一手」を採点する、長距離検索エージェントの訓練法
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
何十手もWeb検索を重ねるエージェントの訓練では「最後に正解したか」しか報酬がなく、途中の良い一手も悪い一手も同じ扱いになる。答えから手がかりを逆算して全ステップを採点するABC(Answer-Backtracked Credit Assignment)と、それで訓練された4BモデルABSeekerを、論文本文に沿って1から解説する。
10
2026-08-13
·
学習手法・アライメント
·
★ 会員
·
論文
·
14分で読めます
論文解説: ABSeeker — 答えから逆算して「良い一手」を採点する、長距離検索エージェントの訓練法
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
何十手もWeb検索を重ねるエージェントの訓練では「最後に正解したか」しか報酬がなく、途中の良い一手も悪い一手も同じ扱いになる。答えから手がかりを逆算して全ステップを採点するABC(Answer-Backtracked Credit Assignment)と、それで訓練された4BモデルABSeekerを、論文本文に沿って1から解説する。
11
2026-08-06
·
学習手法・アライメント
·
★ 会員
·
論文
·
13分で読めます
Instruction Tuning と RLHF を1から解説 — 指示に従うモデルはどう作られるか
Training language models to follow instructions with human feedback
事前学習しただけのモデルが指示に従わないのは能力不足ではなく目的関数のずれ。InstructGPT論文(Ouyang et al., 2022)の本文だけを根拠に、SFT→報酬モデル→強化学習の3段を式まで追い、「1.3Bが175Bを人間評価で上回った」という主張と、論文自身が認めた限界を§番号付きで読む。
12
2026-08-03
·
論文解説
·
★ 会員
·
論文
·
13分で読めます
論文解説 LoRA: Low-Rank Adaptation of Large Language Models — なぜ低ランクで足りるのか
LoRA: Low-Rank Adaptation of Large Language Models
LoRA原論文(Hu et al., 2021)を本文だけを根拠に読み直す。BAという式の意味、論文が実測した「増幅率21倍」、r=1で足りた理由、そして論文自身が残した未検証領域まで。
13
2026-08-03
·
論文解説
·
★ 会員
·
論文
·
13分で読めます
論文解説 LoRA: Low-Rank Adaptation of Large Language Models — なぜ低ランクで足りるのか
LoRA: Low-Rank Adaptation of Large Language Models
LoRA原論文(Hu et al., 2021)を本文だけを根拠に読み直す。BAという式の意味、論文が実測した「増幅率21倍」、r=1で足りた理由、そして論文自身が残した未検証領域まで。