JA EN

#self-improvement

4 記事

01 ·エージェント·★ 会員·論文·17分で読めます 論文解説: HarnessDev — LLMは自分のエージェント・ハーネスを作り、育てられるか HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? エージェントの成績を左右する「モデルの外側」=ハーネスを、LLM自身が一から作り、実行フィードバックで育てられるかを測るベンチマーク HarnessDev を、前提知識ゼロから解説する。作れはするが領域差が激しく、進化の利得は隠されたタスクへほとんど転移しない、という結果を数字で追う。 02 ·評価と審判·★ 会員·論文·16分で読めます 自己改善するAI — 共進化・自己対戦・カリキュラム生成の系譜 Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm 外から教師データを足さずにモデルが強くなる、という現象がどういう条件で成立するのかを1から分解する。AlphaZeroの自己対戦が成立した三つの条件を取り出し、それが言語モデルでどこから壊れるか、共進化とカリキュラム生成がその穴をどう埋めようとしているか、そして自己改善の主張をどう評価すべきかまでを扱う。 03 ·エージェント·★ 会員·論文·22分で読めます 論文解説: PILOT in the Loop — 走っている最中に直す「ライブ自己改善」 PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents エージェントの自己改善は、実行が終わってからでは遅い。監督役と作業役を分け、走行中に軌道修正しながらスキルを貯める PILOT を、比喩から仕組み・実測値・限界まで1から解説する。 04 ·エージェント·★ 会員·論文·10分で読めます 論文解説: Macaron-V1 — 凍結ベース×LoRA混合で「出荷後も育つ」エージェントモデルを作る Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA Mind Labのオープンエージェントモデル群Macaron-V1を論文本文から解説。凍結した744Bベースに4枚のLoRA専門家を重ねてターンごとに1枚選ぶMixture-of-LoRAと、モデル+ハーネスのペアを世代ごとに鍛える再帰的自己改善ループの中身を追う。