JA EN

#agent

12 記事

01 ·エージェント·★ 会員·論文·16分で読めます 論文解説: ZimaBlue — 12万時間の一人称動画でロボットを汎化させる ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training 行動ラベルのない一人称動画12万時間をロボット制御に変換する World Action Model の論文を1から解説。3段階カリキュラム・100次元の統一行動表現・Slow-Fast の非同期二系統で、実機ゼロショット36.1%→77.8%、制御周期33msに至るまで。 02 ·推論・高速化·★ 会員·論文·17分で読めます 論文解説: DART-SD — ツール呼び出しエージェントの「ダイヤ型の解空間」を壊さずに学習する DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents 順不同のサブゴールを含む多ターンのツール呼び出しでは、正解の集合が『ダイヤ格子』状に広がる。軌跡まるごとの模倣がなぜそれを潰すのか、状態グラフで『最初に転んだ地点』を特定してそこから先だけを直す学習で何が変わるのかを、前提知識ゼロから解説する。 03 ·★ 会員·論文·17分で読めます 論文解説: GameWAM — ゲームの「次の景色」と「次の操作」を同時に生成する GameWAM: A World Action Model for Video Games 映像予測と操作生成を1つのモデルに担わせる World–Action Model の論文を1から解説。16手読んで8手だけ実行する block-cycle 制御と、乱数の低周波成分がカメラを勝手に回す LASI という失敗モードまで。 04 ·LLM — 大規模言語モデル·★ 会員·論文·13分で読めます 論文解説: Agentic Artifact Creation — 「生成」と「納品物を組み立てる」はどう違うのか Agentic Artifact Creation: Systems, Evaluation, Principles, and Opportunities 259件の文献を「納品される成果物」という一点から整理したサーベイ。状態・編集・検証という3つの役でエージェント的創出を定義し、6ファミリー・評価の3対象・4原則・6つの未解決問題まで、前提知識ゼロから読み解きます。 05 ·蒸留と圧縮·★ 会員·論文·14分で読めます エージェントを蒸留する — 長い軌跡をどう圧縮するか ReAct: Synergizing Reasoning and Acting in Language Models エージェントの蒸留では、学ぶ単位が「一問一答」から「一局」に変わります。数万トークンの軌跡に対して返ってくる採点は最後の○×ひとつ。この落差をどう埋めるのか — ターン単位のクレジット割当、軌跡の濾過とオンポリシー化、ツール使用の継承を、前提知識ゼロから解きほぐし、長距離エージェントの論文群への地図にします。 06 ·論文解説·★ 会員·論文·19分で読めます 論文解説: ゲーム開発を「検証できる軌跡データ工場」にする — RLHEV と AWoMo Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models 世界モデルに足りないのはデータでも計算でもなく「安い答え合わせ」だ、という主張の論文。ゲームエンジンの自動チェックと開発者の採否判断を組み合わせた後訓練 RLHEV を、前提知識ゼロから式・動く図・実験結果まで追う。 07 ·音声系·★ 会員·論文·21分で読めます 論文解説: VoiceMem — 音声対話に「左脳と右脳」の記憶を、遅延ゼロで VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction リアルタイム音声対話に記憶を持たせるVoiceMemを1から解説。事実を扱う「左脳」と人柄・感情を扱う「右脳」を並列に置き、VADが待つ無音の中に検索を隠すことで、top-5という極小の予算のまま精度を上げる仕組みを読み解く。 08 ·エージェント·★ 会員·論文·12分で読めます マルチエージェント設計パターン — 分担・討論・検証 Improving Factuality and Reasoning in Language Models through Multiagent Debate エージェントを何体並べても、全員が同じ間違い方をするなら1体と変わりません。多数決が効く条件を式で押さえたうえで、分担・討論・敵対的検証の3つの型を、いつ使い、いつ1体で済ませるべきかまで整理します。 09 ·エージェント·無料·15分で読めます MCPとツールプロトコル — エージェントの手をつなぐ規格 LLMがカレンダーやデータベースを触るとき、その「手」はどう繋がっているのか。ツール呼び出しの正体から、MCPが解いたN×M問題、tool定義の設計、そして避けて通れないセキュリティ境界までを前提知識ゼロから解説します。 10 ·エージェント·★ 会員·論文·12分で読めます 【実装】エージェントループを自作する — ツール呼び出しの最小形 ReAct: Synergizing Reasoning and Acting in Language Models 「AIエージェント」の中心はwhile文ひとつです。JSON関数呼び出しの形、ReActが残した設計、そして事故のほとんどが集まる停止条件までを、フレームワークを使わない40行のコードとして1から組み上げます。 11 ·エージェント·★ 会員·論文·11分で読めます AlphaGoを1から — 探索と学習の結婚 Mastering the game of Go with deep neural networks and tree search (Silver et al. 囲碁が長く「解けない」とされた理由から始め、方策ネットワーク・価値ネットワーク・モンテカルロ木探索・自己対戦が互いの弱点をどう埋め合うかを式とコードで解きほぐす。最後に、この設計がLLMの推論時計算にどう受け継がれたかを整理する。 12 ·エージェント·★ 会員·論文·14分で読めます エージェントの記憶設計 — 短期・長期・エピソード MemGPT: Towards LLMs as Operating Systems LLMは何も覚えていません。会話が続いて見えるのは毎ターン全履歴を読み直させているからです。短期・エピソード・長期の3層に分ける設計、想起を決める式、そして最も設計されていない「忘れる」まで、前提知識ゼロから組み立てます。