JA EN

#curriculum-learning

1 記事

01 ·評価と審判·★ 会員·論文·16分で読めます 自己改善するAI — 共進化・自己対戦・カリキュラム生成の系譜 Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm 外から教師データを足さずにモデルが強くなる、という現象がどういう条件で成立するのかを1から分解する。AlphaZeroの自己対戦が成立した三つの条件を取り出し、それが言語モデルでどこから壊れるか、共進化とカリキュラム生成がその穴をどう埋めようとしているか、そして自己改善の主張をどう評価すべきかまでを扱う。