JA EN

#tool-use

9 記事

01 ·エージェント·★ 会員·論文·21分で読めます 論文解説: StarHarness — モデルを凍結したまま「ハーネス」を進化させる StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments モデルの重みを一切変えず、エージェントを取り巻く「ハーネス」(プロンプト・ツール定義・スキル・MCP・サブエージェント・実行ループ)だけを探索で書き換える。企業向け3ベンチマークで20〜35ポイント改善し、進化に使わなかったタスクにも、別のモデルにも効いた。 02 ·蒸留と圧縮·★ 会員·論文·14分で読めます エージェントを蒸留する — 長い軌跡をどう圧縮するか ReAct: Synergizing Reasoning and Acting in Language Models エージェントの蒸留では、学ぶ単位が「一問一答」から「一局」に変わります。数万トークンの軌跡に対して返ってくる採点は最後の○×ひとつ。この落差をどう埋めるのか — ターン単位のクレジット割当、軌跡の濾過とオンポリシー化、ツール使用の継承を、前提知識ゼロから解きほぐし、長距離エージェントの論文群への地図にします。 03 ·エージェント·無料·15分で読めます MCPとツールプロトコル — エージェントの手をつなぐ規格 LLMがカレンダーやデータベースを触るとき、その「手」はどう繋がっているのか。ツール呼び出しの正体から、MCPが解いたN×M問題、tool定義の設計、そして避けて通れないセキュリティ境界までを前提知識ゼロから解説します。 04 ·エージェント·★ 会員·論文·12分で読めます 【実装】エージェントループを自作する — ツール呼び出しの最小形 ReAct: Synergizing Reasoning and Acting in Language Models 「AIエージェント」の中心はwhile文ひとつです。JSON関数呼び出しの形、ReActが残した設計、そして事故のほとんどが集まる停止条件までを、フレームワークを使わない40行のコードとして1から組み上げます。 05 ·エージェント·★ 会員·論文·10分で読めます 論文解説: Video-DeepResearch — 動画を「見て、調べ尽くす」次世代マルチモーダル・エージェント Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent 動画から視覚的手がかりを拾い、Web検索で裏取りする「Video-DeepResearch」の論文を解説。既存モデルが視覚ツールを避ける「モダリティバイアス」と、記憶だけで答える「知識リーク」を、段階的ツール解禁とSFT+GRPOの2段階学習でどう克服したかを、一次資料に沿って読み解きます。 06 ·エージェント·★ 会員·論文·11分で読めます 論文解説: ToolArtist — 検索するか、描くか、描き直すか。それも自分で決める画像生成エージェント ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation 「1955年のソコトラ島で竜血樹脂を採る人」を正しく描くには、絵の腕前より知識の調達が要る。検索・推論・描画のすべてを1つの方策の行動にした完全エージェント型画像生成 ToolArtist を、SFTの変換トリックと二重報酬RL(RAD-GRPO)、WISE 0.79の結果まで論文本文から解説。 07 ·エージェント·★ 会員·論文·11分で読めます 論文解説: EnvACE — 環境まで自分で演じる「world rehearsal」がエージェントRLの環境不足を解く EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning ツール実行環境を一切呼ばずに、LLM自身が「行動役」と「環境役」を交互に演じて強化学習する EnvACE を論文本文から解説。役割別GRPO、テスト時の脳内リハーサル、4ベンチマークでの結果と限界まで。 08 ·エージェント·★ 会員·論文·11分で読めます LLMエージェントを1から解説 — ツール使用とループの設計 ReAct: Synergizing Reasoning and Acting in Language Models 「考える→道具を使う→結果を見て考え直す」というループはどう設計されているのか。ReAct論文(Yao et al., 2022)の本文だけを根拠に、行動空間に言語を足すという発想、function callingの実装の形、実測された失敗モード(ループの暴走・幻覚したツール呼び出し)まで。 09 ·エージェント·★ 会員·論文·11分で読めます LLMエージェントを1から解説 — ツール使用とループの設計 ReAct: Synergizing Reasoning and Acting in Language Models 「考える→道具を使う→結果を見て考え直す」というループはどう設計されているのか。ReAct論文(Yao et al., 2022)の本文だけを根拠に、行動空間に言語を足すという発想、function callingの実装の形、実測された失敗モード(ループの暴走・幻覚したツール呼び出し)まで。