論文解説 J-Zero: 出題者・解答者・審判を同時に育てる「データゼロ」自己進化
外部データも人手のラベルも使わず、モデルが自分で問題を作り、解き、採点して成長する枠組み。J-Zero は採点役(Judge)も一緒に育てることで、従来手法が2反復で頭打ちになる壁を越えた。
J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data
一次資料 — この記事の根拠
論文の発表 2026-08-27→この解説の公開 2026-09-01同月
J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero DataGyouk Chu, Myeongho Jeon, Eunho Yang · 2026-08-27 · v1arXiv:2608.26582論文ページ·PDF原文の要旨(Abstract)を読む
Self-evolving language models have recently emerged as a promising path toward superintelligence, with the advantage of reducing the cost of human supervision. While considerable progress has been made in verifiable domains, self-evolution in unverifiable domains remains substantially less explored. We propose Judge co-adaptation from Zero data (J-Zero), a unified Challenger--Solver--Judge co-evolution framework that supports self-improvement across both domains. The Challenger and Solver co-evolve through an adversarial interaction: the Challenger generates increasingly difficult tasks, while the Solver learns to produce higher-quality responses to them. In parallel, the Judge co-adapts using preference pairs whose ordering is known in advance from how each response was produced, i.e., the Solver's answer over the Challenger's, and its decomposed-and-recombined answer over its one-shot answer, rather than from the Judge's own scores. J-Zero outperforms the baselines by an average of 4.2 points on verifiable and 8.0 points on unverifiable domains, and continues to improve through at least ten iterations, whereas the baselines degrade after two.
審判の目より上手くはなれない
町道場を思い浮かべてください。稽古には3つの役目があります。難しい課題を出す人、それを解く人、出来を採点する人です。
出す人と解く人だけが強くなると、妙なことが起きます。採点者の目が追いつかなくなるのです。以前なら「今のは甘い」と言えた技も、選手が上達しきれば、採点者にはどれも同じ「良い技」に見える。こうなると採点は全部同じ点になり、選手はどちらに直せばいいのかを教えてもらえなくなります。稽古は続いているのに、伸びは止まる。
言語モデルの自己学習でも同じことが起きます。論文が指摘するのは、固定された Judge(採点モデル)はそれ自体が上限になるという点です。凍結された Judge は、すでに内在化している選好の方向にしか Solver を押せず、Solver がその識別できる差を飽和させれば、それ以上の学習は信号を生みません(§1)。だから J-Zero は採点者も一緒に育てます。名前は "Judge co-adaptation from Zero data" の略です。
「答え合わせできる問題」と「できない問題」
自己進化の研究が進んできたのは、検証可能(verifiable)な領域でした。数学やコードのように正解が一意に決まる問題です。正解があれば、採点は文字列比較やコード実行で済みます。
一方、検証不可能(unverifiable)な領域があります。「この企画書を書き直して」のような課題には唯一の正解がなく、品質は人間の選好で決まります(§1)。ここでは検証器の代わりに Judge がスコアを付けるしかなく、先ほどの天井問題が出てきます。
先行研究を整理するとこうです(§2)。外部の正解ラベルに頼る初期の手法、外部のシードデータに頼る手法、そして完全にデータを使わない自己対戦。データ不要の枠組みでも、Absolute Zero はコード実行器で、R-Zero は複数サンプルの多数決で報酬を作りました。どちらも安く堅牢ですが、検証可能な領域にほぼ限られます。J-Zero が埋めるのは「評価信号そのものを学習し、両領域で改善し続ける」という空白です。
3人の登場人物
- Challenger ── 問題を作る。Solver が苦手な問題ほど高報酬
- Solver ── 問題に答える。Judge の点が高いほど高報酬
- Judge ── 課題と回答の組にスカラーのスコアを付ける
Judge の生出力は で に潰して使います(§3.1)。
この式が言っているのは要するに、Solver の成績は Judge の心証がすべてということです。正解表もテストケースも参照しません。答え合わせの相手が「もう一つのモデル」しかいない、という構図がこの1行に出ています。
は 番目の問題、 はその 番目の回答、 はその回答に付いた 0〜1 の点数です。 はシグモイド関数で、〜 の生スコアを 0〜1 に押し込める役をします。
出題者と解答者のミニマックス
Challenger と Solver は GRPO で敵対的に学習します(§3.1)。
左が「Solver が高得点を取れない問題を作れ」、右が「その問題で高得点を取れ」。同じ Judge のスコアを、片方は下げにいき、片方は上げにいきます。
この2本が並んでいることの意味は、要するに難易度表を人が書かなくてよくなるという点にあります。Solver が伸びれば、同じ問題では Challenger の点が下がる。だから Challenger は自動的にもう一段難しい側へ動きます。カリキュラムが Solver の現在地に追随して勝手に作られる、というのがミニマックスにした狙いです。
ただし完全なゼロサムではありません。難易度だけを最大化すると、Challenger は似た問題を量産したり壊れた出力を吐いたりするからです。そこで論文は R-Zero に倣い、難易度・重複ペナルティ・形式チェックを合成します(§3.1)。難易度は、問題 への Solver の 個の回答の平均点 を取って 。重複は問題間の距離を で測り、近すぎるものをクラスタにまとめて大きいほど減点。形式は <question> タグで囲めているかを見ます。
「Solver が解けない度合いから、他と似ている度合いを引いたものが出題者の点数」。負にならないよう下限を 0 で切っています。要するに、難しいだけでは点にならず、他と違う難しさでなければ点にならないという式です。似た難問ばかりが並ぶと Solver はその1種類にだけ強くなって止まるので、重複ペナルティは「別の方向に難しい問題」へ舵を切らせる役を負っています。
どの問題で学ばせるかを、点数のばらつきで選ぶ
Challenger を更新したら凍結し、候補問題を大きめに生成します。そこから訓練用を選ぶ基準が、地味だが効く工夫です(§3.1)。
この式が言っているのは要するに、点数が暴れる問題ほど良い教材だということです。何度解かせても高得点なら教えることがなく、何度解かせても低得点なら手が届かない。どちらも報酬が平らで、伸ばす方向を示せません。残すのは答えるたびに点が上下する問題だ、という選び方です。
同じ問題に 個答えさせ、その点数の標準偏差を測り、大きい上位 問だけを使う。ばらつきが大きい問題とは「うまくいく時とダメな時がある」=ちょうど能力の境界にある問題です。論文はこれを Bae et al. (2026) の理論に接続します。訓練から期待できる方策の改善量は報酬の分散で下から抑えられるので、分散の大きい問題こそ伸びしろが大きい。R-Zero は二値の検証器なので「正答率が中くらい」で選びましたが、Judge は連続値を返すため、分散がその連続版のフィルタになるという整理です。
実務上の注意として、ばらつきはサンプリング温度にも左右されます(論文の設定は温度 1.0 / top- 0.99、表4)。温度を下げすぎると回答が揃い、この選別基準そのものが機能しません。
コメント
コメントにはログインが必要です