PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#search-agent
1 記事
01
2026-08-13
·
学習手法・アライメント
·
★ 会員
·
論文
·
14分で読めます
論文解説: ABSeeker — 答えから逆算して「良い一手」を採点する、長距離検索エージェントの訓練法
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
何十手もWeb検索を重ねるエージェントの訓練では「最後に正解したか」しか報酬がなく、途中の良い一手も悪い一手も同じ扱いになる。答えから手がかりを逆算して全ステップを採点するABC(Answer-Backtracked Credit Assignment)と、それで訓練された4BモデルABSeekerを、論文本文に沿って1から解説する。