PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#reward-model
4 記事
01
2026-09-03
·
学習手法・アライメント
·
★ 会員
·
論文
·
18分で読めます
論文解説: StudentSim — 「その生徒そのもの」を訓練で作る学習者シミュレータ
StudentSim: Training LLM-based Student Simulators
AI家庭教師を鍛えるための『練習台になる生徒』を、実際の学習記録から訓練して作る枠組み。行動忠実度(F)と指導反応性(R)という2軸の定義から、プール学習→生徒別特化の2段パイプライン、報酬モデルとしての応用までを1から解説する。
02
2026-09-01
·
論文解説
·
★ 会員
·
論文
·
16分で読めます
論文解説 J-Zero: 出題者・解答者・審判を同時に育てる「データゼロ」自己進化
J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data
外部データも人手のラベルも使わず、モデルが自分で問題を作り、解き、採点して成長する枠組み。J-Zero は採点役(Judge)も一緒に育てることで、従来手法が2反復で頭打ちになる壁を越えた。
03
2026-08-31
·
推論・高速化
·
★ 会員
·
論文
·
19分で読めます
論文解説: Self-OPD — 教師モデルなしで、画像生成モデルが自分を蒸留する
Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
教師モデルを使わず、生成の各ステップで自分の分身をK本つくって採点し、良い枝に引き寄せ悪い枝から遠ざける。フローマッチング系画像生成のアライメント手法 Self-OPD を、前提知識ゼロから解説します。
04
2026-08-13
·
エージェント
·
★ 会員
·
論文
·
12分で読めます
論文解説: OSReward — AIの「採点者」は信用できるか。コンピュータ操作エージェントの報酬を測り直す
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
PCやスマホを操作するAIエージェントの成否を判定する「VLM審判」は、実は失敗を成功と誤認する甘さバイアスを共有していた——1019本の人手検証済み軌跡でこれを暴き、30〜60倍安い公開報酬モデルOS-Shepherdで埋める論文を、前提知識ゼロから解説する。