JA EN

#reward-hacking

3 記事

01 ·音声系·★ 会員·論文·12分で読めます 論文解説: Last Translation Benchmark — 「モデルが壊れる例」と検証ルールで翻訳を測り直す Last Translation Benchmark 機械翻訳のベンチマークは飽和し、自動指標も人手評価も信用しきれない。その袋小路に対し『先端モデルが壊れる例』を人手で集め、例ごとに手書きの検証ルールを添える——原題 Last Translation Benchmark を前提知識ゼロから読み解く。 02 ·エージェント·★ 会員·論文·12分で読めます 論文解説: CogEvol — 報酬が測れないものを、強化学習は静かに壊す CogEvol: Towards Efficient and Reliable Learning Environment Generation 教材をワンパスで生成するモデル群 CogEvol の技術報告。中心にあるのは「スクリーンショットだけを見る報酬でRLを回すと、見た目は立派で遊べないゲームが量産される」という実際に起きた事故と、その修正の記録。 03 ·評価と審判·★ 会員·論文·12分で読めます 報酬ハッキング — 測り方を決めると、そこが壊れる Concrete Problems in AI Safety 指標を決めた瞬間から、その指標は壊れ始める。Goodhartの法則がなぜ統計的に避けられないのかを代理報酬のずれから説明し、ボートレースの周回からRLHFの冗長化・おべっか・テストのハードコードまで実例で追い、最適化圧と真の性能の乖離を検出する方法とKL正則化などの現実的な対策を扱う。