PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#reward-hacking
3 記事
01
2026-09-08
·
音声系
·
★ 会員
·
論文
·
12分で読めます
論文解説: Last Translation Benchmark — 「モデルが壊れる例」と検証ルールで翻訳を測り直す
Last Translation Benchmark
機械翻訳のベンチマークは飽和し、自動指標も人手評価も信用しきれない。その袋小路に対し『先端モデルが壊れる例』を人手で集め、例ごとに手書きの検証ルールを添える——原題 Last Translation Benchmark を前提知識ゼロから読み解く。
02
2026-09-07
·
エージェント
·
★ 会員
·
論文
·
12分で読めます
論文解説: CogEvol — 報酬が測れないものを、強化学習は静かに壊す
CogEvol: Towards Efficient and Reliable Learning Environment Generation
教材をワンパスで生成するモデル群 CogEvol の技術報告。中心にあるのは「スクリーンショットだけを見る報酬でRLを回すと、見た目は立派で遊べないゲームが量産される」という実際に起きた事故と、その修正の記録。
03
2026-09-03
·
評価と審判
·
★ 会員
·
論文
·
12分で読めます
報酬ハッキング — 測り方を決めると、そこが壊れる
Concrete Problems in AI Safety
指標を決めた瞬間から、その指標は壊れ始める。Goodhartの法則がなぜ統計的に避けられないのかを代理報酬のずれから説明し、ボートレースの周回からRLHFの冗長化・おべっか・テストのハードコードまで実例で追い、最適化圧と真の性能の乖離を検出する方法とKL正則化などの現実的な対策を扱う。