PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#video-mllm
1 記事
01
2026-08-27
·
★ 会員
·
論文
·
15分で読めます
論文解説: Annotations as Rollouts — 正解データを「9本目の答案」として強化学習に混ぜる
Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
動画MLLMの強化学習では、モデルが引いた答案の中に正解がほとんど現れず学習信号が痩せる。OraRLは注釈データ自体を答案の1本として束に加え、そのとき壊れる『advantageの反転』を分解して直した手法。