JA EN

#video-mllm

1 記事

01 ·★ 会員·論文·15分で読めます 論文解説: Annotations as Rollouts — 正解データを「9本目の答案」として強化学習に混ぜる Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs 動画MLLMの強化学習では、モデルが引いた答案の中に正解がほとんど現れず学習信号が痩せる。OraRLは注釈データ自体を答案の1本として束に加え、そのとき壊れる『advantageの反転』を分解して直した手法。