JA EN
·★ 会員·論文·15分で読めます

論文解説: Annotations as Rollouts — 正解データを「9本目の答案」として強化学習に混ぜる

動画MLLMの強化学習では、モデルが引いた答案の中に正解がほとんど現れず学習信号が痩せる。OraRLは注釈データ自体を答案の1本として束に加え、そのとき壊れる『advantageの反転』を分解して直した手法。

対象imageタスクgeneration

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

一次資料 — この記事の根拠

論文の発表 2026-08-20この解説の公開 2026-08-27同月

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMsYunheng Li, Guohong Mu, Hao Li ほか · 2026-08-20 · v1arXiv:2608.20492論文ページ·PDF
原文の要旨(Abstract)を読む

Multimodal large language models (MLLMs) have become a prevailing paradigm for unified video perception. However, post-training on large multi-task datasets remains challenging, as existing reinforcement learning methods sample on-policy groups with few high-quality rollouts even with costly chain-of-thought (CoT) generation. In this paper, we study the sample efficiency and scalability of RL post-training for video MLLMs and introduce OraRL. We identify an overlooked role for annotations: Beyond scoring rollouts, each can enter its on-policy group as an oracle rollout, a direct positive optimization target. Direct oracle integration, however, is nontrivial: a high-reward oracle raises the group baseline and inverts otherwise positive policy advantages, a failure we term advantage inversion. At the core of OraRL is a decoupled advantage estimator: policy rollouts determine an oracle-free baseline, while the oracle-policy gap modulates both a directional gain and a separate detached oracle advantage. Sign-balanced pruning improves efficiency: by retaining only the oracle and the strongest rollouts of each sign, OraRL requires just 2.2x the step time of SFT, less than half the 4.9x required by GRPO with CoT. OraRL scales with model size and data, surpassing its backbone from 0.8B to 9B and GRPO up to 100k prompts. Without chain-of-thought, Video-ORA-9B decodes in 130 ms instead of 4,780 ms. Compared with the respective prior best models, it raises temporal mIoU from 62.5 to 66.0, tracking AO from 73.0 to 78.2, segmentation from 64.3 to 70.4, and the three-benchmark spatial-intelligence macro average from 51.0 to 56.1; on VSI-Bench, it scores 73.1 against 55.0 for GPT-5 and 55.1 for Gemini-3-Pro.


模範解答を配らない採点者

予備校の採点者を想像してください。生徒(モデル)に同じ問題を8回解かせ、8枚の答案に点数をつけて返す。ところが採点者は模範解答を手元に持っているのに、それを絶対に見せません。生徒は「この8枚のうちどれがマシか」だけを手がかりに勉強することになります。

四択なら8枚のどこかに正解が混じるので、これでも回ります。しかし答えが「動画の12.4秒から18.9秒」だったら、8枚とも外れるほうが普通です。正解に近い答案が1枚もない束からは、どちらへ伸ばせばいいかがほとんど読み取れません。

この論文(arXiv:2608.20492)は、ここで一行の発想の転換をします。採点者が握っている正解を、9枚目の答案として束にそのまま入れてしまえばいい。著者らはこれを annotation-as-rollout と呼び、周辺を整えた学習法を OraRL と名付けました。

まずGRPOを1から

ここでの強化学習は、指示チューニングとRLHFで扱う PPO 系の系譜にある GRPO(Group Relative Policy Optimization)です。手順は3段階(§3.1)。

  1. 1つの入力(動画+指示)に対し、モデルに nn 通りの出力をサンプリングさせる。この1本1本が rollout
  2. 各 rollout を正解データと突き合わせて報酬 rir_i をつける(例: 予測した区間と正解区間の重なり具合)
  3. 「グループの平均より上か下か」で各 rollout の良し悪しを決める

3番目が GRPO の肝で、価値関数(critic)を別に学習せずに済みます。

AiGRPO=riμgrpσgrp+ϵ,μgrp=1nj=1nrjA_{i}^{\mathrm{GRPO}}=\frac{r_{i}-\mu_{\mathrm{grp}}}{\sigma_{\mathrm{grp}}+\epsilon},\qquad \mu_{\mathrm{grp}}=\frac{1}{n}\sum_{j=1}^{n}r_{j}
(1)

AiA_iadvantage(優位性)で、その rollout を「もっと出やすくする」か「出にくくする」かを決める係数です。μgrp\mu_{\mathrm{grp}} はグループ内の報酬の平均、σgrp\sigma_{\mathrm{grp}} はそのばらつき、ϵ\epsilon はゼロ割り防止の小さな定数。要するに 「同じ問題を8回解いた中で、平均より良かった答案だけ褒める」AiA_i が正なら褒める側、負なら抑える側です。

FIG 1rolloutは毎回この分布からサイコロを振って引く。論文の設定は温度1.0・top-p 0.85(表17)。温度を下げると分布が尖り、8本が似た答えに寄る=グループ内の報酬のばらつきが縮み、比較から得られる情報も減る

動画では「正のアンカー」が出てこない

ここで動画特有の事情が効きます。統一的な動画知覚(動画理解の全体像)が扱うのは、時刻区間・矩形・セグメンテーションマスク・追跡軌跡といった連続値で構造を持つ答えです。四択と違い、サンプリングで偶然ぴったり当たることはまずありません。

論文の言い方では、既存手法において注釈は rolloutを採点する参照でしかなく、多くのグループが信頼できる正のアンカーを持たないまま更新されます(§1)。実測でも、時間グラウンディングでは報酬が疎なせいで 17.5%のグループに正の rollout が1本も残りません(§4.10)。

「Chain-of-Thought を長く書かせれば当たるのでは」という発想は、この論文では否定されます。CoTありのGRPOは時間グラウンディング3データセットの平均が 58.5、CoTなしが 58.7 とほぼ同じで、1ステップの学習時間だけが 93.9秒 → 135.6秒(+44.4%) に伸びました。しかもRLの前段階で、CoTを入れると素のバックボーンの平均が 3.9ポイント下がっています(§4.7)。長く考えさせても、当たらないものは当たりません。

注釈を9本目のrolloutにする

OraRL の中核は拍子抜けするほど単純です(§3.2)。注釈 yy をモデルの応答フォーマットへ書き換える変換 TtaskT_{\mathrm{task}} を用意し、oracle rollout として束に足すだけ。

ogt=Ttask(y),Oaug=Oop{ogt},Oaug=n+1o_{\mathrm{gt}}=T_{\mathrm{task}}(y),\quad \mathcal{O}_{\mathrm{aug}}=\mathcal{O}_{\mathrm{op}}\cup\{o_{\mathrm{gt}}\},\quad |\mathcal{O}_{\mathrm{aug}}|=n+1

ogto_{\mathrm{gt}} が「正解を答案の形式で書いたもの」、Oop\mathcal{O}_{\mathrm{op}} がモデル自身の nn 本、Oaug\mathcal{O}_{\mathrm{aug}} が合わせた n+1n+1 本です。つまり置き換えではなく追加。既存の8本を残すので、探索を犠牲にせず正のアンカーだけが増えます。中身は選択肢・時刻区間・矩形・矩形の軌跡などタスクで変わりますが、更新則は1本で共通です(§3.3)。教師モデルの出力を真似る知識蒸留と違い、oracleは元から付いている注釈なので教師モデルが要りません(§2)。

ところが9本をまとめて正規化すると、GRPOより性能が落ちます。3タスク共通プロトコルで、GRPOの平均60.3が素朴な正解注入では 55.4。追跡タスクは11.9ポイントの下落です(§4.9)。原因は算数レベルで説明できます。

この先にあるもの

§

ここから先は会員限定です

解説記事371本・教科書26章・学生モード48単元・論文精読6本が、月額¥490ですべて読み放題になります。新しい解説は毎日3本ずつ増えます。いつでも解約でき、解約後も期間の終わりまで読めます。

会員の方はログインすると続きが表示されます

参考文献

  1. Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian et al.. (2026-08-20) Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs. arXiv:2608.20492論文ページ·PDF

本記事は上記論文の本文にもとづいて執筆しています。数値・主張は原典を優先してください。

コメント

コメントにはログインが必要です