JA EN

#reward-model

4 記事

01 ·学習手法・アライメント·★ 会員·論文·18分で読めます 論文解説: StudentSim — 「その生徒そのもの」を訓練で作る学習者シミュレータ StudentSim: Training LLM-based Student Simulators AI家庭教師を鍛えるための『練習台になる生徒』を、実際の学習記録から訓練して作る枠組み。行動忠実度(F)と指導反応性(R)という2軸の定義から、プール学習→生徒別特化の2段パイプライン、報酬モデルとしての応用までを1から解説する。 02 ·論文解説·★ 会員·論文·16分で読めます 論文解説 J-Zero: 出題者・解答者・審判を同時に育てる「データゼロ」自己進化 J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data 外部データも人手のラベルも使わず、モデルが自分で問題を作り、解き、採点して成長する枠組み。J-Zero は採点役(Judge)も一緒に育てることで、従来手法が2反復で頭打ちになる壁を越えた。 03 ·推論・高速化·★ 会員·論文·19分で読めます 論文解説: Self-OPD — 教師モデルなしで、画像生成モデルが自分を蒸留する Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher 教師モデルを使わず、生成の各ステップで自分の分身をK本つくって採点し、良い枝に引き寄せ悪い枝から遠ざける。フローマッチング系画像生成のアライメント手法 Self-OPD を、前提知識ゼロから解説します。 04 ·エージェント·★ 会員·論文·12分で読めます 論文解説: OSReward — AIの「採点者」は信用できるか。コンピュータ操作エージェントの報酬を測り直す OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models PCやスマホを操作するAIエージェントの成否を判定する「VLM審判」は、実は失敗を成功と誤認する甘さバイアスを共有していた——1019本の人手検証済み軌跡でこれを暴き、30〜60倍安い公開報酬モデルOS-Shepherdで埋める論文を、前提知識ゼロから解説する。