PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#self-play
2 記事
01
2026-09-03
·
評価と審判
·
★ 会員
·
論文
·
16分で読めます
自己改善するAI — 共進化・自己対戦・カリキュラム生成の系譜
Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm
外から教師データを足さずにモデルが強くなる、という現象がどういう条件で成立するのかを1から分解する。AlphaZeroの自己対戦が成立した三つの条件を取り出し、それが言語モデルでどこから壊れるか、共進化とカリキュラム生成がその穴をどう埋めようとしているか、そして自己改善の主張をどう評価すべきかまでを扱う。
02
2026-08-27
·
エージェント
·
★ 会員
·
論文
·
11分で読めます
AlphaGoを1から — 探索と学習の結婚
Mastering the game of Go with deep neural networks and tree search (Silver et al.
囲碁が長く「解けない」とされた理由から始め、方策ネットワーク・価値ネットワーク・モンテカルロ木探索・自己対戦が互いの弱点をどう埋め合うかを式とコードで解きほぐす。最後に、この設計がLLMの推論時計算にどう受け継がれたかを整理する。