論文解説: Agent Skillsはなぜ効くのか、そしてどこで壊れるのか
エージェントに手順書(Skill)を持たせると成績が上がる。その中身を8,135件の実行記録と528組の対照軌跡で解剖した論文を、前提知識ゼロから読み解く。効くのは知識の注入ではなく「手順の錨」であり、棚が大きくなると取り出しが壊れる。
Demystifying Agent Skills: Why They Work-Until They Don't
一次資料 — この記事の根拠
論文の発表 2026-08-14→この解説の公開 2026-08-22同月
Demystifying Agent Skills: Why They Work—Until They Don'tZhiyuan Jiang, Fangrui Huang, Hanwen Xing ほか · 2026-08-14 · v1arXiv:2608.14036論文ページ·PDF原文の要旨(Abstract)を読む
Skills have emerged as a practical and effective approach for enhancing LLM agents at inference time through structured packages of knowledge. However, existing evaluations largely measure whether skills improve aggregated task success, leaving a more fundamental question underexplored: \emph{\textbf{When do skills help, why do they work, and where do they fail?}} Through controlled experiments across various benchmarks, agent harnesses and LLMs, we isolate the effects of representation, outcome annotation, retrieval difficulty, and cross-framework robustness of skills. To further answer this question, we design a contrastive study that combines controlled quantitative experiments with paired trajectory analysis. We normalize 8,135 trial records from controlled experiments and retain 238 valid unique labels from 240 open-coded records. We consolidate these observations into a taxonomy of three high-level categories and twelve skill-use modes: skills work when noisy trajectories become procedural anchors that stabilize execution. Skills improve over Workflow Memory by 6.06 points in matched comparisons. Procedural anchoring accounts for 65.7\% of skill cases, versus 4.5\% for explicit knowledge injection, showing that skills stabilize action rather than inject missing facts. Retrieval is a separate bottleneck: as pools grow from 5 to 100, actual-use precision falls from 29.6\% to 3.3\%. Confusable distractors impair offline identification, yet downstream success remains stable; exact ground-truth invocation is neither sufficient nor necessary. Skills fail under brittle assumptions, incompatible contexts, or insufficient adaptation. These findings move evaluation beyond aggregate success rates and guide reliable self-evolving agents.
レシピカードとしてのスキル
料理を思い浮かべてください。誰かに「ハンバーグを作って」と頼むとき、渡し方は三通りあります。何も渡さず勘でやってもらう。過去に作ったときの作業記録を丸ごと渡す(塩を入れすぎて捨てた話も、冷蔵庫を三回開けた話も込みで)。あるいは、その記録から要点だけを抜いた一枚のレシピカードを渡す。
LLMエージェントの世界で「スキル(Skill)」と呼ばれるものは、三つ目のレシピカードにあたります。論文の言葉では、スキルとは過去の実行の記録そのものではなく、何をするか・何を確認するか・どんな落とし穴を避けるかを圧縮した記述です(§1)。二つ目に対応するのが Workflow Memory(ワークフロー記憶)で、これは過去の軌跡を整形しただけのものです。
ここが今回の急所です。両者はまったく同じ経験から作られるのに、包み方だけが違う。だから比べれば、「経験を与えたから良くなった」のか「経験の書き方が良かったのか」を切り分けられます。レシピカードが効くのは中身が増えたからではなく、要らない話が落ちているからかもしれない——それを実験で確かめよう、というのが出発点です。
「効くか」ではなく「なぜ効くか」を測る
これまでのスキル研究は、ほぼ集計成功率だけを見てきました。論文はこれを不十分だと指摘します。集計値は、スキルを読み込む前後で振る舞いの何が変わったのか、なぜ同じスキルがあるタスクを助け別のタスクを壊すのかを、何ひとつ説明しないからです(§1)。
そこで採られたのが、同じタスクを Raw(何も渡さない)/ Workflow Memory / Skill の三本立てで走らせ、軌跡どうしを突き合わせる対照実験です。8,135件の試行記録を共通形式に正規化し(うち7,837件に軌跡の書き起こしが残る)、240件を抽出して自由記述でラベルを付け、有効な238ラベルを 3つの大分類と12のモード に集約しました(§4)。
この分類が機械の思いつきでないことは人手で確かめられています。238ラベルそれぞれについて3本の軌跡を人が読んで裏を取り(計714回の照合)、さらに人が独立に12モードへ振り分け直したところ、一致率95.8%、Cohen's κ = 0.952 でした(§4, Table 3)。
実験の骨格: 同じ経験を、二通りに包む
各タスクで成功軌跡と失敗軌跡を集め、予算固定の配合グリッドを作ります。5s0f(成功5・失敗0)から 0s5f まで6通り。同じ配合から Workflow Memory と Skill を作り、同じタスクで評価する——素材を固定し、包み方だけを動かす設計です(§3.3)。ベンチは Terminal-Bench 2.0 / Terminal-Bench-Pro / SkillsBench、エージェントは Codex + GPT-5.3-Codex と Gemini CLI + Gemini-3.1-Pro-Preview(§3.2)。
Table 1 の一例。Codex の Terminal-Bench 2.0 では Raw が 0.5935、5s0f で Skill は 0.7548。ところが同じ素材の Workflow Memory は 0.4452 と素を下回ります。失敗軌跡だけの 0s5f でも Skill 0.5161 対 Workflow 0.2839 でした。
スキルの一生 — 五つの関門
論文が最終的に描くのは、スキルを「記憶を注入する仕掛け」ではなくライフサイクルとして見る絵です(§5.3)。役に立つには、①経験が適切な粒度に蒸留され、②棚に保管され、③その場面で検索され、④エージェントに呼び出され、⑤現在の文脈へ適応される、という五つの関門をすべて通らねばなりません。どこか一つで落ちれば、棚に正解があっても成果はゼロです。
このうち③の検索は、タスクの指示文とスキルの説明文をそれぞれベクトルにして、向きの近さで順位を付けます(論文は Qwen3-Embedding-0.6B を使用、§3.2)。物差しは内積とコサイン類似度で、下の図で手触りが掴めます。中身が違っても向きさえ揃えば高得点になる、という性質が後で効いてきます。
コメント
コメントにはログインが必要です