JA EN

#rlvr

2 記事

01 ·★ 会員·論文·21分で読めます 論文解説: VBVR-Pro — 「絵で考える」AIを、訓練でき・採点でき・比較できるようにした実験場 VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 画像や動画の生成そのものを「思考の場」として扱うネイティブ視覚推論。VBVR-Proは300個の手続き生成タスクと、VLM審判に頼らない決定論的な採点器を用意し、画像・動画・インターリーブ生成を同じ土俵で比較した。前提知識ゼロから読める解説。 02 ·★ 会員·論文·12分で読めます 論文解説: DEFT-RLVR — 自動運転VLMに未来の軌跡を「先に見せる」と推論が捏造される Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs 自動運転VLMのCoT教師データ作成で正解軌跡を先に見せると、教師は理由を後付けし幻覚が29%→50%に倍増する——この「軌跡アンカリングバイアス」を実証し、走行計画を選択問題化(AD-MCQ)して軌跡の開示を決断の後に遅延させる強化学習 DEFT-RLVR (arXiv:2608.01755) を論文本文だけを根拠に解説する。