#agents
109 記事
01
·エージェント·★ 会員·論文·17分で読めます
論文解説: Terminal-Universe — エージェントの作業ログを、何度でも使える実行環境に戻す
Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
エージェントの作業ログ(軌跡)に残ったファイル操作をリプレイし、欠けた部分を補完エージェントに埋めさせて実行可能なワークスペースを復元する枠組み。37.3kの環境を作り、Qwen3.5-27BのSFTでTerminal-Bench 2.1を+11.9ポイント改善した。
02
·エージェント·★ 会員·論文·17分で読めます
論文解説: Terminal-Universe — エージェントの作業ログを、何度でも使える実行環境に戻す
Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
エージェントの作業ログ(軌跡)に残ったファイル操作をリプレイし、欠けた部分を補完エージェントに埋めさせて実行可能なワークスペースを復元する枠組み。37.3kの環境を作り、Qwen3.5-27BのSFTでTerminal-Bench 2.1を+11.9ポイント改善した。
03
·エージェント·★ 会員·論文·12分で読めます
論文解説: CogEvol — 報酬が測れないものを、強化学習は静かに壊す
CogEvol: Towards Efficient and Reliable Learning Environment Generation
教材をワンパスで生成するモデル群 CogEvol の技術報告。中心にあるのは「スクリーンショットだけを見る報酬でRLを回すと、見た目は立派で遊べないゲームが量産される」という実際に起きた事故と、その修正の記録。
04
·エージェント·★ 会員·論文·12分で読めます
論文解説: CogEvol — 報酬が測れないものを、強化学習は静かに壊す
CogEvol: Towards Efficient and Reliable Learning Environment Generation
教材をワンパスで生成するモデル群 CogEvol の技術報告。中心にあるのは「スクリーンショットだけを見る報酬でRLを回すと、見た目は立派で遊べないゲームが量産される」という実際に起きた事故と、その修正の記録。
05
·エージェント·★ 会員·論文·17分で読めます
論文解説: HarnessDev — LLMは自分のエージェント・ハーネスを作り、育てられるか
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
エージェントの成績を左右する「モデルの外側」=ハーネスを、LLM自身が一から作り、実行フィードバックで育てられるかを測るベンチマーク HarnessDev を、前提知識ゼロから解説する。作れはするが領域差が激しく、進化の利得は隠されたタスクへほとんど転移しない、という結果を数字で追う。
06
·エージェント·★ 会員·論文·17分で読めます
論文解説: HarnessDev — LLMは自分のエージェント・ハーネスを作り、育てられるか
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
エージェントの成績を左右する「モデルの外側」=ハーネスを、LLM自身が一から作り、実行フィードバックで育てられるかを測るベンチマーク HarnessDev を、前提知識ゼロから解説する。作れはするが領域差が激しく、進化の利得は隠されたタスクへほとんど転移しない、という結果を数字で追う。
07
·エージェント·★ 会員·論文·16分で読めます
論文解説: EarlyEval — エージェント評価を「途中で打ち切って」安くする
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
エージェントの評価は1回数百ドルかかる。EarlyEvalは「結末は途中の振る舞いから読める」という発見を使い、実行を途中で止めて費用を13〜26%削る。仕組み・実験値・限界を論文本文から解説。
08
·エージェント·★ 会員·論文·16分で読めます
論文解説: EarlyEval — エージェント評価を「途中で打ち切って」安くする
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
エージェントの評価は1回数百ドルかかる。EarlyEvalは「結末は途中の振る舞いから読める」という発見を使い、実行を途中で止めて費用を13〜26%削る。仕組み・実験値・限界を論文本文から解説。
09
·エージェント·★ 会員·論文·20分で読めます
論文解説: Aspire — モデルは「曖昧な目標」から自己進化できるか
Aspire: Can Models Self-Evolve from Vague Goals?
「もっと数学が得意になれ」だけを渡されたエージェントは、自分で学ぶ内容と検証方法を決めて本当に強くなれるのか。隠された520問で測るベンチマーク Aspire を前提知識ゼロから解説し、学習ループは回るのに能力が伸びないという結果を数字で追う。
10
·エージェント·★ 会員·論文·20分で読めます
論文解説: Aspire — モデルは「曖昧な目標」から自己進化できるか
Aspire: Can Models Self-Evolve from Vague Goals?
「もっと数学が得意になれ」だけを渡されたエージェントは、自分で学ぶ内容と検証方法を決めて本当に強くなれるのか。隠された520問で測るベンチマーク Aspire を前提知識ゼロから解説し、学習ループは回るのに能力が伸びないという結果を数字で追う。
11
·エージェント·★ 会員·論文·16分で読めます
論文解説: ZimaBlue — 12万時間の一人称動画でロボットを汎化させる
ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training
行動ラベルのない一人称動画12万時間をロボット制御に変換する World Action Model の論文を1から解説。3段階カリキュラム・100次元の統一行動表現・Slow-Fast の非同期二系統で、実機ゼロショット36.1%→77.8%、制御周期33msに至るまで。
12
·エージェント·★ 会員·論文·15分で読めます
論文解説: 良いエージェント学習データとは何か — ACE(正確さ・複雑さ・多様性)という見方
What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
エージェント用の学習データを (環境, タスク, 対話, 検証器) の4点セットとして捉え直し、生成を「正確さで通し、複雑さで置き、多様さで広げる」制約付き分布設計として整理したサーベイ論文の解説。
13
·エージェント·★ 会員·論文·15分で読めます
論文解説: 良いエージェント学習データとは何か — ACE(正確さ・複雑さ・多様性)という見方
What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents
エージェント用の学習データを (環境, タスク, 対話, 検証器) の4点セットとして捉え直し、生成を「正確さで通し、複雑さで置き、多様さで広げる」制約付き分布設計として整理したサーベイ論文の解説。
14
·エージェント·★ 会員·論文·13分で読めます
論文解説 UrbanGround: 街に降ろされたMLLMエージェントは、どこで崩れるのか
UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
香港の全域3D地理データから作った実スケールの街に、MLLMエージェントを一人称で降ろす。視覚認識は9割、方位理解は4割、長距離ナビはほぼ0%。「見える」と「動ける」の断絶を測ったベンチマーク論文を1から解説する。
15
·エージェント·★ 会員·論文·13分で読めます
論文解説 UrbanGround: 街に降ろされたMLLMエージェントは、どこで崩れるのか
UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
香港の全域3D地理データから作った実スケールの街に、MLLMエージェントを一人称で降ろす。視覚認識は9割、方位理解は4割、長距離ナビはほぼ0%。「見える」と「動ける」の断絶を測ったベンチマーク論文を1から解説する。
16
·エージェント·★ 会員·論文·19分で読めます
論文解説: UI-Venus-2 — 画面を見て操作するAIを、ベンチマークから実運用へ
UI-Venus-2 Technical Report
スマホ・ブラウザ・デスクトップを画面だけ見て操作するGUIエージェント UI-Venus-2 の技術報告書を、前提知識ゼロから解説。環境・タスク・検証を同時に広げる設計と、その限界までを論文本文だけを根拠に読む。
17
·エージェント·★ 会員·論文·19分で読めます
論文解説: UI-Venus-2 — 画面を見て操作するAIを、ベンチマークから実運用へ
UI-Venus-2 Technical Report
スマホ・ブラウザ・デスクトップを画面だけ見て操作するGUIエージェント UI-Venus-2 の技術報告書を、前提知識ゼロから解説。環境・タスク・検証を同時に広げる設計と、その限界までを論文本文だけを根拠に読む。
18
·エージェント·★ 会員·論文·22分で読めます
論文解説: Training Agents to Evolve with Their Harness — ハーネスごと進化するエージェントを訓練する
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
プロンプトやツール定義を毎週書き換える本番環境で、小型モデルはなぜ壊れるのか。淘宝ライブのAIアバター配信を動かすチームが提案する Harness-Aware Training(HAT)を、比喩から数式・実測値・限界まで1から解説する。
19
·エージェント·★ 会員·論文·22分で読めます
論文解説: Training Agents to Evolve with Their Harness — ハーネスごと進化するエージェントを訓練する
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
プロンプトやツール定義を毎週書き換える本番環境で、小型モデルはなぜ壊れるのか。淘宝ライブのAIアバター配信を動かすチームが提案する Harness-Aware Training(HAT)を、比喩から数式・実測値・限界まで1から解説する。
20
·エージェント·★ 会員·論文·21分で読めます
論文解説: StarHarness — モデルを凍結したまま「ハーネス」を進化させる
StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
モデルの重みを一切変えず、エージェントを取り巻く「ハーネス」(プロンプト・ツール定義・スキル・MCP・サブエージェント・実行ループ)だけを探索で書き換える。企業向け3ベンチマークで20〜35ポイント改善し、進化に使わなかったタスクにも、別のモデルにも効いた。
21
·エージェント·★ 会員·論文·21分で読めます
論文解説: StarHarness — モデルを凍結したまま「ハーネス」を進化させる
StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
モデルの重みを一切変えず、エージェントを取り巻く「ハーネス」(プロンプト・ツール定義・スキル・MCP・サブエージェント・実行ループ)だけを探索で書き換える。企業向け3ベンチマークで20〜35ポイント改善し、進化に使わなかったタスクにも、別のモデルにも効いた。
22
·エージェント·★ 会員·論文·15分で読めます
論文解説: SecOPD — トークン1個ずつ採点して、適応的プロンプトインジェクションを1桁下げる
SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
防御用に微調整したLLMも、適応的なプロンプトインジェクションにはほぼ100%破られてきた。原因は「出力全体に1つの点数」しか与えない訓練にある。注入前のきれいな入力を見た教師にトークン単位で採点させるSecOPDを、前提知識ゼロから解説する。
23
·エージェント·★ 会員·論文·15分で読めます
論文解説: SecOPD — トークン1個ずつ採点して、適応的プロンプトインジェクションを1桁下げる
SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
防御用に微調整したLLMも、適応的なプロンプトインジェクションにはほぼ100%破られてきた。原因は「出力全体に1つの点数」しか与えない訓練にある。注入前のきれいな入力を見た教師にトークン単位で採点させるSecOPDを、前提知識ゼロから解説する。
24
·エージェント·★ 会員·論文·16分で読めます
論文解説: Repo-To-Skill — GitHubリポジトリを「AIのためのスキル」に蒸留する
Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
モデルでもハーネスでもない第三の層「運用知識」を、1000本のGitHubリポジトリから5,353個の検証済みスキルへ蒸留する DisCo と AREX-Skill ライブラリ。MLE-bench 31.11%→72.89% という結果と、その内訳・効かなかった場合を一次資料から読み解く。
25
·エージェント·★ 会員·論文·16分で読めます
論文解説: Repo-To-Skill — GitHubリポジトリを「AIのためのスキル」に蒸留する
Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
モデルでもハーネスでもない第三の層「運用知識」を、1000本のGitHubリポジトリから5,353個の検証済みスキルへ蒸留する DisCo と AREX-Skill ライブラリ。MLE-bench 31.11%→72.89% という結果と、その内訳・効かなかった場合を一次資料から読み解く。
26
·エージェント·★ 会員·論文·22分で読めます
論文解説: PILOT in the Loop — 走っている最中に直す「ライブ自己改善」
PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
エージェントの自己改善は、実行が終わってからでは遅い。監督役と作業役を分け、走行中に軌道修正しながらスキルを貯める PILOT を、比喩から仕組み・実測値・限界まで1から解説する。
27
·エージェント·★ 会員·論文·22分で読めます
論文解説: PILOT in the Loop — 走っている最中に直す「ライブ自己改善」
PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
エージェントの自己改善は、実行が終わってからでは遅い。監督役と作業役を分け、走行中に軌道修正しながらスキルを貯める PILOT を、比喩から仕組み・実測値・限界まで1から解説する。
28
·エージェント·★ 会員·論文·17分で読めます
論文解説: LoopArena — コーディングエージェントを「操縦する側」を測る
LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering
コーディングエージェントに指示を出し続ける『外側のループ』の良し悪しを、エージェント本体を固定したまま測るベンチマーク LoopArena を、前提知識ゼロから解説する。最良でも完全タスク成功率24.69%という結果の読み方まで。
29
·エージェント·★ 会員·論文·17分で読めます
論文解説: LoopArena — コーディングエージェントを「操縦する側」を測る
LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering
コーディングエージェントに指示を出し続ける『外側のループ』の良し悪しを、エージェント本体を固定したまま測るベンチマーク LoopArena を、前提知識ゼロから解説する。最良でも完全タスク成功率24.69%という結果の読み方まで。
30
·エージェント·★ 会員·論文·19分で読めます
論文解説: Code World Model — コーディングエージェントを「世界の脳」にする
Code World Model: Coding Agent as World Brain
世界の「進み方」をコードに、世界の「見え方」を動画モデルに分担させる枠組み Code World Model を、前提知識ゼロから解説。粗い条件映像=プロキシという接続部の設計と、その限界まで読み解く。
31
·エージェント·★ 会員·論文·19分で読めます
論文解説: Code World Model — コーディングエージェントを「世界の脳」にする
Code World Model: Coding Agent as World Brain
世界の「進み方」をコードに、世界の「見え方」を動画モデルに分担させる枠組み Code World Model を、前提知識ゼロから解説。粗い条件映像=プロキシという接続部の設計と、その限界まで読み解く。
32
·エージェント·★ 会員·論文·18分で読めます
論文解説: Code as Worlds — 世界を「実行できるコード」として書き起こすエージェント
Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning
物理世界を「実行できるコード」で表現し、提案→実行→描画→検証のループで観測に合う世界仮説を探すCode-as-Worldを、論文本文から解説。EWRの3成分、エージェント的発見ループ、QuantiPhyでの結果、論文が認める限界まで。
33
·エージェント·★ 会員·論文·18分で読めます
論文解説: Code as Worlds — 世界を「実行できるコード」として書き起こすエージェント
Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning
物理世界を「実行できるコード」で表現し、提案→実行→描画→検証のループで観測に合う世界仮説を探すCode-as-Worldを、論文本文から解説。EWRの3成分、エージェント的発見ループ、QuantiPhyでの結果、論文が認める限界まで。
34
·エージェント·★ 会員·論文·16分で読めます
論文解説: AutoSaddler — エージェントの失敗ログから「壊れないハーネス」を自動で育てる
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
LLMエージェントの外側を固める「ハーネス」(プロンプト・ツール・ミドルウェア)を、失敗トレースの診断とパッチ生成の反復で自動最適化する枠組みAutoSaddlerを、前提知識ゼロから解説する。GAIA2/SWE-Bench Pro/Terminal-Bench 2.0で基準ハーネスをそれぞれ9.0/9.6/10.0ポイント上回った。
35
·エージェント·★ 会員·論文·16分で読めます
論文解説: AutoSaddler — エージェントの失敗ログから「壊れないハーネス」を自動で育てる
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
LLMエージェントの外側を固める「ハーネス」(プロンプト・ツール・ミドルウェア)を、失敗トレースの診断とパッチ生成の反復で自動最適化する枠組みAutoSaddlerを、前提知識ゼロから解説する。GAIA2/SWE-Bench Pro/Terminal-Bench 2.0で基準ハーネスをそれぞれ9.0/9.6/10.0ポイント上回った。
36
·評価と審判·無料·論文·15分で読めます
エージェント評価ベンチ地図 — SWE-bench・GAIA・OSWorldは何を測るか
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
エージェント評価の代表3本(SWE-bench・GAIA・OSWorld)が実際に何を測っているかを、採点方式の違いから解きほぐす。汚染とリークの4類型、そして発表されたスコアを自分の用途向けに読み替える手順まで。
37
·エージェント·★ 会員·論文·23分で読めます
論文解説: JIT-Agent — エージェントの「ハーネス」をその場で書き起こすモデル
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
エージェントの性能はモデルだけで決まらない。記憶・計画・行動・道具の4モジュールからなる「ハーネス」をタスクごとに生成する専用モデル JIT-Agent を、前提知識なしで解説する。
38
·エージェント·★ 会員·論文·23分で読めます
論文解説: JIT-Agent — エージェントの「ハーネス」をその場で書き起こすモデル
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
エージェントの性能はモデルだけで決まらない。記憶・計画・行動・道具の4モジュールからなる「ハーネス」をタスクごとに生成する専用モデル JIT-Agent を、前提知識なしで解説する。
39
·エージェント·★ 会員·論文·11分で読めます
論文解説: FrontierChallenge — 科学の仕事を「最後まで納品できたか」で測る
FrontierChallenge: Evaluating Scientific Workflow Completion
科学ワークフローを最後まで完遂できるかを測るベンチマーク FrontierChallenge の解説。平均点87.9でも完全達成は20.6%、電気化学では平均94.9でPass Rate 0%。未達の軌跡の75.5%が「完了しました」と述べて終わっていた。
40
·エージェント·★ 会員·論文·11分で読めます
論文解説: FrontierChallenge — 科学の仕事を「最後まで納品できたか」で測る
FrontierChallenge: Evaluating Scientific Workflow Completion
科学ワークフローを最後まで完遂できるかを測るベンチマーク FrontierChallenge の解説。平均点87.9でも完全達成は20.6%、電気化学では平均94.9でPass Rate 0%。未達の軌跡の75.5%が「完了しました」と述べて終わっていた。
41
·蒸留と圧縮·★ 会員·論文·14分で読めます
エージェントを蒸留する — 長い軌跡をどう圧縮するか
ReAct: Synergizing Reasoning and Acting in Language Models
エージェントの蒸留では、学ぶ単位が「一問一答」から「一局」に変わります。数万トークンの軌跡に対して返ってくる採点は最後の○×ひとつ。この落差をどう埋めるのか — ターン単位のクレジット割当、軌跡の濾過とオンポリシー化、ツール使用の継承を、前提知識ゼロから解きほぐし、長距離エージェントの論文群への地図にします。
42
·エージェント·★ 会員·論文·14分で読めます
論文解説: SWE-bench Science — コーディングエージェントは「科学のコード」を直せるか
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
科学ソフトウェアの修理をコーディングエージェントに解かせるベンチマーク SWE-bench Science(119タスク・98リポジトリ・20分野)の解説。最良のエージェントでも pass@1 は50%未満で、4つの失敗機構と「科学知識は必ずしも効かない」というアブレーション結果を読み解く。
43
·エージェント·★ 会員·論文·14分で読めます
論文解説: SWE-bench Science — コーディングエージェントは「科学のコード」を直せるか
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
科学ソフトウェアの修理をコーディングエージェントに解かせるベンチマーク SWE-bench Science(119タスク・98リポジトリ・20分野)の解説。最良のエージェントでも pass@1 は50%未満で、4つの失敗機構と「科学知識は必ずしも効かない」というアブレーション結果を読み解く。
44
·エージェント·★ 会員·論文·12分で読めます
マルチエージェント設計パターン — 分担・討論・検証
Improving Factuality and Reasoning in Language Models through Multiagent Debate
エージェントを何体並べても、全員が同じ間違い方をするなら1体と変わりません。多数決が効く条件を式で押さえたうえで、分担・討論・敵対的検証の3つの型を、いつ使い、いつ1体で済ませるべきかまで整理します。
45
·エージェント·無料·15分で読めます
MCPとツールプロトコル — エージェントの手をつなぐ規格
LLMがカレンダーやデータベースを触るとき、その「手」はどう繋がっているのか。ツール呼び出しの正体から、MCPが解いたN×M問題、tool定義の設計、そして避けて通れないセキュリティ境界までを前提知識ゼロから解説します。
46
·エージェント·★ 会員·論文·18分で読めます
論文解説: FreeToken — 手元のPCを「一台の推論基盤」として使い切る帯域適応型MoEサービング
FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
公開重みの巨大MoEを、データセンターではなく手元のPCで動かすためのサービング系FreeToken。ミスしたエキスパートをPCIeで運ぶかCPUでその場で計算するかを、実測した2つの帯域の比だけで決めるq*ポリシーを中心に読み解く。
47
·エージェント·★ 会員·論文·18分で読めます
論文解説: FreeToken — 手元のPCを「一台の推論基盤」として使い切る帯域適応型MoEサービング
FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
公開重みの巨大MoEを、データセンターではなく手元のPCで動かすためのサービング系FreeToken。ミスしたエキスパートをPCIeで運ぶかCPUでその場で計算するかを、実測した2つの帯域の比だけで決めるq*ポリシーを中心に読み解く。
48
·エージェント·★ 会員·論文·18分で読めます
論文解説: Embodied-Navigator(TAMP-Nav) — VLMに「指を差させる」と、ナビゲーションは速く強くなる
Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
3D座標を出させる代わりにVLMへ2Dピクセルを「指差し」させ、考える場所と憶える場所を絞り、二段のGRPOで揃える。R2R-CEで成功率66.2%、1タスク16.58秒を9万本の軌跡だけで達成した設計を、論文本文に沿って1から解説する。
49
·エージェント·★ 会員·論文·12分で読めます
【実装】エージェントループを自作する — ツール呼び出しの最小形
ReAct: Synergizing Reasoning and Acting in Language Models
「AIエージェント」の中心はwhile文ひとつです。JSON関数呼び出しの形、ReActが残した設計、そして事故のほとんどが集まる停止条件までを、フレームワークを使わない40行のコードとして1から組み上げます。
50
·エージェント·★ 会員·論文·13分で読めます
論文解説: ASI-Bench — 手引きを1枚ずつ剥がして、AIの「自力」を測る
ASI-Bench: At the Dawn of Artificial Superintelligence
同じ研究課題から人間の方法論的な手引きだけを段階的に剥がし、AIエージェントがどこまで自力で進めるかを測るベンチマーク ASI-Bench を、一次資料である論文本文から解説する。平均スコアは50.91→29.10→26.62へ落ち、崩れる場所は「手法選び」ではなかった。
51
·エージェント·★ 会員·論文·13分で読めます
論文解説: ASI-Bench — 手引きを1枚ずつ剥がして、AIの「自力」を測る
ASI-Bench: At the Dawn of Artificial Superintelligence
同じ研究課題から人間の方法論的な手引きだけを段階的に剥がし、AIエージェントがどこまで自力で進めるかを測るベンチマーク ASI-Bench を、一次資料である論文本文から解説する。平均スコアは50.91→29.10→26.62へ落ち、崩れる場所は「手法選び」ではなかった。
52
·論文解説·★ 会員·論文·14分で読めます
論文解説: Apodex 1.1 — 「完了した仕事」を単位にエージェントをスケールさせる
Apodex 1.1: Scaling Agentic Intelligence for Complex Work
モデルを大きくするのでも推論時間を伸ばすのでもなく、「環境」と「協調」の2面をスケールさせる——Apodexチームの技術報告を、タスク契約の式からAgentOSの納品ゲート、数字と限界まで1から解説する。
53
·エージェント·★ 会員·論文·11分で読めます
AlphaGoを1から — 探索と学習の結婚
Mastering the game of Go with deep neural networks and tree search (Silver et al.
囲碁が長く「解けない」とされた理由から始め、方策ネットワーク・価値ネットワーク・モンテカルロ木探索・自己対戦が互いの弱点をどう埋め合うかを式とコードで解きほぐす。最後に、この設計がLLMの推論時計算にどう受け継がれたかを整理する。
54
·エージェント·★ 会員·論文·14分で読めます
エージェントの記憶設計 — 短期・長期・エピソード
MemGPT: Towards LLMs as Operating Systems
LLMは何も覚えていません。会話が続いて見えるのは毎ターン全履歴を読み直させているからです。短期・エピソード・長期の3層に分ける設計、想起を決める式、そして最も設計されていない「忘れる」まで、前提知識ゼロから組み立てます。
55
·エージェント·★ 会員·論文·15分で読めます
エージェント評価 — ベンチとハーネスの作法
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
エージェントのスコアは「モデルの点」ではなく「モデル+ハーネス+環境+採点規則の点」です。SWE-benchの1件がどんな部品でできているか、手数が伸びると一手の差がなぜ桁で効くか、リポジトリやネットワークから答えが漏れる四つの経路、そして部分点を安全に設計する条件までを1から扱います。
56
·セキュリティ·★ 会員·論文·13分で読めます
LLMセキュリティ — プロンプトインジェクションと防御
Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection
LLMは「上司の指示」と「書類に書かれた文字」を区別できない。この一点から生まれる直接注入・間接注入・ツール境界の問題を前提知識ゼロから解き、プロンプトで守ろうとする誤りと、実行層に境界を置く多層防御の組み方までを扱う。
57
·論文解説·★ 会員·論文·18分で読めます
論文解説 Large Discovery Models — LLMに「次に何を試すべきか」を教える価値信号
Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search
LLMは案を出せても、その案が本当に良いかを自分では採点できない。論文 Large Discovery Models は、LLMの提案分布をガウス過程由来の「獲得値」で傾けることで、高価な実験予算のもとでの探索を回す枠組みを示す。式から実験数値まで1から解説。
58
·エージェント·★ 会員·論文·21分で読めます
論文解説: Zetta ζ — 方策を凍結したまま、ロボットが実行中に自分を直す「閉ループ・ハーネス」
Zetta $ζ$: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
エピソードが終わってから反省する既存の身体エージェントに対し、Zettaは「コードで書かれた監視役」を行動と同じ頻度で回し、失敗の兆候が出た瞬間に介入する。方策の重みを一切触らずに成功率を押し上げた設計を、論文本文に沿って1から解説する。
59
·エージェント·★ 会員·論文·21分で読めます
論文解説: Zetta ζ — 方策を凍結したまま、ロボットが実行中に自分を直す「閉ループ・ハーネス」
Zetta $ζ$: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
エピソードが終わってから反省する既存の身体エージェントに対し、Zettaは「コードで書かれた監視役」を行動と同じ頻度で回し、失敗の兆候が出た瞬間に介入する。方策の重みを一切触らずに成功率を押し上げた設計を、論文本文に沿って1から解説する。
60
·エージェント·★ 会員·論文·17分で読めます
論文解説: StateM — モデルの重みを1gも動かさず、Terminal-Bench 2.1で95.3%・実行費15ドルへ
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
長時間タスクのエージェントは、各ステップを解けるモデルを積んでいても落ちる。StateMは重みを触らず「実行の器」だけを鍛え、Terminal-Bench 2.1で95.3%、最終スコアのAPI費を574.68ドルから約15ドルへ下げたと報告する。ハーネススケーリングという賭けを1から解説する。
61
·エージェント·★ 会員·論文·17分で読めます
論文解説: StateM — モデルの重みを1gも動かさず、Terminal-Bench 2.1で95.3%・実行費15ドルへ
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
長時間タスクのエージェントは、各ステップを解けるモデルを積んでいても落ちる。StateMは重みを触らず「実行の器」だけを鍛え、Terminal-Bench 2.1で95.3%、最終スコアのAPI費を574.68ドルから約15ドルへ下げたと報告する。ハーネススケーリングという賭けを1から解説する。
62
·エージェント·★ 会員·論文·18分で読めます
論文解説 SemaPLC — 「できました」と言わせない検証ゲート型エージェント
SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation
工場の制御コードをLLMに書かせる研究の多くは「動いて見せる」で止まっていた。SemaPLCは外部検査のログが揃うまでエージェントに完了を宣言させない設計で、実機ランタイム上の挙動スコアをベースラインの最大31.4に対し52.2まで引き上げた。
63
·エージェント·★ 会員·論文·18分で読めます
論文解説 SemaPLC — 「できました」と言わせない検証ゲート型エージェント
SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation
工場の制御コードをLLMに書かせる研究の多くは「動いて見せる」で止まっていた。SemaPLCは外部検査のログが揃うまでエージェントに完了を宣言させない設計で、実機ランタイム上の挙動スコアをベースラインの最大31.4に対し52.2まで引き上げた。
64
·エージェント·★ 会員·論文·15分で読めます
論文解説: OmniScientist — 生データを直接「見る」AI科学者。36ケースを1つのエンジンで走らせる
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
研究の全工程を自動化しても、AIが見ているのが「誰かが作った要約表」だけなら、たどり着ける発見は最初から限られる。生の波形・画像・3D点群を研究の全期間で直接観測させ、検問をPythonのコードで強制する OmniScientist を、36ケースの結果と地震波データの21.7%という発見まで論文本文から解説。
65
·エージェント·★ 会員·論文·15分で読めます
論文解説: OmniScientist — 生データを直接「見る」AI科学者。36ケースを1つのエンジンで走らせる
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
研究の全工程を自動化しても、AIが見ているのが「誰かが作った要約表」だけなら、たどり着ける発見は最初から限られる。生の波形・画像・3D点群を研究の全期間で直接観測させ、検問をPythonのコードで強制する OmniScientist を、36ケースの結果と地震波データの21.7%という発見まで論文本文から解説。
66
·エージェント·★ 会員·論文·17分で読めます
論文解説: FACET — 指示・環境・解答・採点を「同じ実行状態」に接地させる課題合成
FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
ターミナル課題は「指示文・環境・模範解答・採点器」の4点セット。FACETは環境を先に建てて動かし、その実現済み状態を全部品の共通の地面にすることで整合を取る。7万件のスキルから6,078課題を作り、1.2Kの成功軌跡だけでQwen3.5を4B/9B/27Bとも底上げした論文を1から解説する。
67
·エージェント·★ 会員·論文·17分で読めます
論文解説: FACET — 指示・環境・解答・採点を「同じ実行状態」に接地させる課題合成
FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
ターミナル課題は「指示文・環境・模範解答・採点器」の4点セット。FACETは環境を先に建てて動かし、その実現済み状態を全部品の共通の地面にすることで整合を取る。7万件のスキルから6,078課題を作り、1.2Kの成功軌跡だけでQwen3.5を4B/9B/27Bとも底上げした論文を1から解説する。
68
·エージェント·★ 会員·論文·12分で読めます
論文解説: EnvHarness — 練習場を作り直さず、外から「治具」をかぶせてエージェントを鍛える
EnvHarness: Awakening Static Worlds for Agent Learning
LLMエージェントの学習環境は手作りで静的、エージェントの弱点にも上達にも追随しない。EnvHarnessは環境の中身を書き換えずに外から挙動を作り替えるプラグイン層で、元の検証器はそのまま保つ。その設計と自動化役EnvRiggerを、前提知識ゼロから解く。
69
·エージェント·★ 会員·論文·12分で読めます
論文解説: EnvHarness — 練習場を作り直さず、外から「治具」をかぶせてエージェントを鍛える
EnvHarness: Awakening Static Worlds for Agent Learning
LLMエージェントの学習環境は手作りで静的、エージェントの弱点にも上達にも追随しない。EnvHarnessは環境の中身を書き換えずに外から挙動を作り替えるプラグイン層で、元の検証器はそのまま保つ。その設計と自動化役EnvRiggerを、前提知識ゼロから解く。
70
·エージェント·★ 会員·論文·11分で読めます
論文解説: Agent Skillsはなぜ効くのか、そしてどこで壊れるのか
Demystifying Agent Skills: Why They Work-Until They Don't
エージェントに手順書(Skill)を持たせると成績が上がる。その中身を8,135件の実行記録と528組の対照軌跡で解剖した論文を、前提知識ゼロから読み解く。効くのは知識の注入ではなく「手順の錨」であり、棚が大きくなると取り出しが壊れる。
71
·エージェント·★ 会員·論文·11分で読めます
論文解説: Agent Skillsはなぜ効くのか、そしてどこで壊れるのか
Demystifying Agent Skills: Why They Work-Until They Don't
エージェントに手順書(Skill)を持たせると成績が上がる。その中身を8,135件の実行記録と528組の対照軌跡で解剖した論文を、前提知識ゼロから読み解く。効くのは知識の注入ではなく「手順の錨」であり、棚が大きくなると取り出しが壊れる。
72
·エージェント·★ 会員·論文·18分で読めます
論文解説: Co-RL — 正解ラベルなしでも、群れの多様性から推論が立ち上がる
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
自分の答えを自分で採点し続けるとモデルは崩壊する。Co-RLは「隣のエージェントの多数決」を報酬にしてその輪を断ち切り、正解ラベルを一切使わずに教師あり学習に並ぶ。仕組み・力学の証明・実験値・落とし穴まで論文本文から解説する。
73
·エージェント·★ 会員·論文·18分で読めます
論文解説: Co-RL — 正解ラベルなしでも、群れの多様性から推論が立ち上がる
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
自分の答えを自分で採点し続けるとモデルは崩壊する。Co-RLは「隣のエージェントの多数決」を報酬にしてその輪を断ち切り、正解ラベルを一切使わずに教師あり学習に並ぶ。仕組み・力学の証明・実験値・落とし穴まで論文本文から解説する。
74
·推論・高速化·★ 会員·論文·23分で読めます
論文解説: Agentic ESOpt — 逆伝播をやめて「モデルを揺らす」だけで、長丁場のLLMエージェントを鍛える
Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements
勾配を一切計算せず、パラメータにノイズを足した分身をG体走らせて良かった方向へ寄せるだけ——推論と同じGPUメモリ(8.41GB)で27Bの全パラメータを更新し、15手必要な数独でGRPOに12.50ポイント差をつけたNUSらの論文を、1から解説する。
75
·エージェント·★ 会員·論文·10分で読めます
論文解説: Video-DeepResearch — 動画を「見て、調べ尽くす」次世代マルチモーダル・エージェント
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
動画から視覚的手がかりを拾い、Web検索で裏取りする「Video-DeepResearch」の論文を解説。既存モデルが視覚ツールを避ける「モダリティバイアス」と、記憶だけで答える「知識リーク」を、段階的ツール解禁とSFT+GRPOの2段階学習でどう克服したかを、一次資料に沿って読み解きます。
76
·エージェント·★ 会員·論文·10分で読めます
論文解説: Video-DeepResearch — 動画を「見て、調べ尽くす」次世代マルチモーダル・エージェント
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
動画から視覚的手がかりを拾い、Web検索で裏取りする「Video-DeepResearch」の論文を解説。既存モデルが視覚ツールを避ける「モダリティバイアス」と、記憶だけで答える「知識リーク」を、段階的ツール解禁とSFT+GRPOの2段階学習でどう克服したかを、一次資料に沿って読み解きます。
77
·エージェント·★ 会員·論文·11分で読めます
論文解説: ToolArtist — 検索するか、描くか、描き直すか。それも自分で決める画像生成エージェント
ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation
「1955年のソコトラ島で竜血樹脂を採る人」を正しく描くには、絵の腕前より知識の調達が要る。検索・推論・描画のすべてを1つの方策の行動にした完全エージェント型画像生成 ToolArtist を、SFTの変換トリックと二重報酬RL(RAD-GRPO)、WISE 0.79の結果まで論文本文から解説。
78
·エージェント·★ 会員·論文·11分で読めます
論文解説: ToolArtist — 検索するか、描くか、描き直すか。それも自分で決める画像生成エージェント
ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation
「1955年のソコトラ島で竜血樹脂を採る人」を正しく描くには、絵の腕前より知識の調達が要る。検索・推論・描画のすべてを1つの方策の行動にした完全エージェント型画像生成 ToolArtist を、SFTの変換トリックと二重報酬RL(RAD-GRPO)、WISE 0.79の結果まで論文本文から解説。
79
·エージェント·★ 会員·論文·15分で読めます
論文解説: Recursive Synthesis — 検証済みタスクを「増築」して、長時間ターミナル課題を4万件量産する
Recursive Synthesis for Long-Horizon Terminal Tasks
1件数百〜数千ドルかかる長時間ターミナルタスクを、検証済みの種から再帰的に増築して約$0.05で量産するRST。15ラウンドで37,484件、模範解答は中央値67行から374行へ難化し、その軌跡でQwen3.5をSFT+PPOで実際に強くした——Tencentらのデータ合成論文を1から解説する。
80
·エージェント·★ 会員·論文·15分で読めます
論文解説: Recursive Synthesis — 検証済みタスクを「増築」して、長時間ターミナル課題を4万件量産する
Recursive Synthesis for Long-Horizon Terminal Tasks
1件数百〜数千ドルかかる長時間ターミナルタスクを、検証済みの種から再帰的に増築して約$0.05で量産するRST。15ラウンドで37,484件、模範解答は中央値67行から374行へ難化し、その軌跡でQwen3.5をSFT+PPOで実際に強くした——Tencentらのデータ合成論文を1から解説する。
81
·エージェント·★ 会員·論文·11分で読めます
論文解説: Qwen-UI-Agent — スマホもPCも操る「実世界基準」のGUIエージェントはこう作られた
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
AlibabaのMAI-UIチームが公開したGUIエージェント基盤モデルのテクニカルレポートを解説。実機100台超での訓練、GUI+CLIの混成行動空間、100ターン超のオンラインRLで、実機ベンチ92.2%を叩き出した作り方を1から読み解く。
82
·エージェント·★ 会員·論文·11分で読めます
論文解説: Qwen-UI-Agent — スマホもPCも操る「実世界基準」のGUIエージェントはこう作られた
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
AlibabaのMAI-UIチームが公開したGUIエージェント基盤モデルのテクニカルレポートを解説。実機100台超での訓練、GUI+CLIの混成行動空間、100ターン超のオンラインRLで、実機ベンチ92.2%を叩き出した作り方を1から読み解く。
83
·エージェント·★ 会員·論文·12分で読めます
論文解説: OSReward — AIの「採点者」は信用できるか。コンピュータ操作エージェントの報酬を測り直す
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
PCやスマホを操作するAIエージェントの成否を判定する「VLM審判」は、実は失敗を成功と誤認する甘さバイアスを共有していた——1019本の人手検証済み軌跡でこれを暴き、30〜60倍安い公開報酬モデルOS-Shepherdで埋める論文を、前提知識ゼロから解説する。
84
·エージェント·★ 会員·論文·12分で読めます
論文解説: OSReward — AIの「採点者」は信用できるか。コンピュータ操作エージェントの報酬を測り直す
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
PCやスマホを操作するAIエージェントの成否を判定する「VLM審判」は、実は失敗を成功と誤認する甘さバイアスを共有していた——1019本の人手検証済み軌跡でこれを暴き、30〜60倍安い公開報酬モデルOS-Shepherdで埋める論文を、前提知識ゼロから解説する。
85
·エージェント·★ 会員·論文·11分で読めます
論文解説: Metis — 記憶を外付けせず、モデルの中に住まわせる「Memory Foundation Model」
Metis: Memory Foundation Model
AIエージェントの記憶は今もRAGなどの「外付け」が主流。この論文は記憶をモデル本体の順伝播に内蔵する Memory Foundation Model を提唱し、初のプロトタイプ Metis を提案する。覚える・忘れる・更新するを勾配なしのforward計算だけで実行する仕組みと、その実力・限界を1から解説。
86
·エージェント·★ 会員·論文·11分で読めます
論文解説: Metis — 記憶を外付けせず、モデルの中に住まわせる「Memory Foundation Model」
Metis: Memory Foundation Model
AIエージェントの記憶は今もRAGなどの「外付け」が主流。この論文は記憶をモデル本体の順伝播に内蔵する Memory Foundation Model を提唱し、初のプロトタイプ Metis を提案する。覚える・忘れる・更新するを勾配なしのforward計算だけで実行する仕組みと、その実力・限界を1から解説。
87
·エージェント·★ 会員·論文·12分で読めます
論文解説: MerchantBench — LLMエージェントは1年間ネットショップを経営できるか。人間の27.3%しか稼げない理由
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
365日のEC店舗経営シミュレーションでLLMエージェントの「長期一貫性」を測るMerchantBenchを論文本文から解説。最良構成でも人間の平均純資産の27.3%にとどまる理由を、活動の減衰・早すぎる撤退・証拠に合わない方針固定化という失敗パターンから読み解く。
88
·エージェント·★ 会員·論文·12分で読めます
論文解説: MerchantBench — LLMエージェントは1年間ネットショップを経営できるか。人間の27.3%しか稼げない理由
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
365日のEC店舗経営シミュレーションでLLMエージェントの「長期一貫性」を測るMerchantBenchを論文本文から解説。最良構成でも人間の平均純資産の27.3%にとどまる理由を、活動の減衰・早すぎる撤退・証拠に合わない方針固定化という失敗パターンから読み解く。
89
·エージェント·★ 会員·論文·12分で読めます
論文解説: Mental World Modeling — 物理だけでなく「心」まで遷移させるワールドモデル
Mental World Modeling
シーンの物理を完璧に追えても、人の次の行動は当てられない——信念・意図・感情・規範を状態変数として持ち、行動が物理と心を同時に更新する Mental World Modeling (MWM) の定式化と、訓練不要ベースライン Mentis による8モデル検証を、論文本文から数値つきで解説する。
90
·エージェント·★ 会員·論文·12分で読めます
論文解説: Mental World Modeling — 物理だけでなく「心」まで遷移させるワールドモデル
Mental World Modeling
シーンの物理を完璧に追えても、人の次の行動は当てられない——信念・意図・感情・規範を状態変数として持ち、行動が物理と心を同時に更新する Mental World Modeling (MWM) の定式化と、訓練不要ベースライン Mentis による8モデル検証を、論文本文から数値つきで解説する。
91
·エージェント·★ 会員·論文·10分で読めます
論文解説: LongHorizon-Harness — 長時間タスクは「実行」ではなく「状態管理」で解く
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
モデルを一切変えずに、タスク状態を実行の外に置き「管理→実行→監査」のループで回すだけで、長時間タスクの成績が大きく伸びる——Alibaba DreamXチームのハーネス設計論文を、比喩と擬似コードで1から解説する。
92
·エージェント·★ 会員·論文·10分で読めます
論文解説: LongHorizon-Harness — 長時間タスクは「実行」ではなく「状態管理」で解く
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
モデルを一切変えずに、タスク状態を実行の外に置き「管理→実行→監査」のループで回すだけで、長時間タスクの成績が大きく伸びる——Alibaba DreamXチームのハーネス設計論文を、比喩と擬似コードで1から解説する。
93
·エージェント·★ 会員·論文·16分で読めます
論文解説: Frontis-MA1 — 「AIを作るAI」を鍛える。MLエンジニアリングで再帰的自己改善に一歩迫るOpenMLE
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
「解くモデル」ではなく「解を改善する操作」を実行結果で訓練し、その操作で進化探索を回す——OpenMLEスタックと35BモデルFrontis-MA1を論文本文から解説。MLE-Bench Liteでの39.39%→71.21%という伸びの内訳、探索効率の仕組み、そして論文自身が認める限界まで。
94
·エージェント·★ 会員·論文·16分で読めます
論文解説: Frontis-MA1 — 「AIを作るAI」を鍛える。MLエンジニアリングで再帰的自己改善に一歩迫るOpenMLE
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
「解くモデル」ではなく「解を改善する操作」を実行結果で訓練し、その操作で進化探索を回す——OpenMLEスタックと35BモデルFrontis-MA1を論文本文から解説。MLE-Bench Liteでの39.39%→71.21%という伸びの内訳、探索効率の仕組み、そして論文自身が認める限界まで。
95
·エージェント·★ 会員·論文·11分で読めます
End-to-End運転を1から — 認識から制御までを1つのネットワークで
End to End Learning for Self-Driving Cars
カメラ画像からハンドル操作までを1つのニューラルネットで学ぶEnd-to-End自動運転を、前提知識ゼロから解説。モジュール型との思想の違い、模倣学習と分布シフト、「平均を出すと事故る」多峰性問題、そして解釈性と検証がなぜ難しいかまでを一気に追う。
96
·エージェント·★ 会員·論文·11分で読めます
End-to-End運転を1から — 認識から制御までを1つのネットワークで
End to End Learning for Self-Driving Cars
カメラ画像からハンドル操作までを1つのニューラルネットで学ぶEnd-to-End自動運転を、前提知識ゼロから解説。モジュール型との思想の違い、模倣学習と分布シフト、「平均を出すと事故る」多峰性問題、そして解釈性と検証がなぜ難しいかまでを一気に追う。
97
·エージェント·★ 会員·論文·15分で読めます
論文解説: ComBodied Agents — エージェントの「作用対象」を人そのものに置き直す
ComBodied Agents: a New Paradigm of Human-Centric Agentic AI
デジタルエージェントはソフトの状態を、身体エージェントは物理の状態を書き換える。では「人の状態」を第一の対象にするのは誰か。Combodied Agents は知覚・縦断記憶・Personal World Model・介入方針を1つの閉ループに束ね、成功の基準を課題達成から『主体性が保たれたか』へ移す枠組みを提案する。実験を持たない立場表明論文として、その骨格と限界を本文に沿って読む。
98
·エージェント·★ 会員·論文·15分で読めます
論文解説: ComBodied Agents — エージェントの「作用対象」を人そのものに置き直す
ComBodied Agents: a New Paradigm of Human-Centric Agentic AI
デジタルエージェントはソフトの状態を、身体エージェントは物理の状態を書き換える。では「人の状態」を第一の対象にするのは誰か。Combodied Agents は知覚・縦断記憶・Personal World Model・介入方針を1つの閉ループに束ね、成功の基準を課題達成から『主体性が保たれたか』へ移す枠組みを提案する。実験を持たない立場表明論文として、その骨格と限界を本文に沿って読む。
99
·エージェント·★ 会員·論文·11分で読めます
論文解説: 共進化するエージェント系 — 人間の設計を超えた自己進化への三段階
Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design
「デプロイ後も賢くなり続けるエージェント」はなぜ頭打ちになるのか。相手・環境・進化の仕組みそのものを順に動かしていく三段階の分類を、サーベイ論文の本文から1から解説する。定義の式、各段階の代表手法、評価と安全の未解決点まで。
100
·エージェント·★ 会員·論文·11分で読めます
論文解説: 共進化するエージェント系 — 人間の設計を超えた自己進化への三段階
Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design
「デプロイ後も賢くなり続けるエージェント」はなぜ頭打ちになるのか。相手・環境・進化の仕組みそのものを順に動かしていく三段階の分類を、サーベイ論文の本文から1から解説する。定義の式、各段階の代表手法、評価と安全の未解決点まで。
101
·エージェント·★ 会員·論文·13分で読めます
論文解説: SWE-Bench ProMax — 多言語・大規模リファクタリングでコーディングエージェントの本当の実力を測る
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
SWE-benchの飽和と採点欠陥への回答として登場した、7言語・平均11.4ファイル修正の大規模リファクタリングベンチマークを論文本文から解説。最強モデルでも41.2%しか解けない理由と、支配的な失敗モード「やり切らないリファクタリング」を読み解く。
102
·エージェント·★ 会員·論文·13分で読めます
論文解説: SWE-Bench ProMax — 多言語・大規模リファクタリングでコーディングエージェントの本当の実力を測る
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
SWE-benchの飽和と採点欠陥への回答として登場した、7言語・平均11.4ファイル修正の大規模リファクタリングベンチマークを論文本文から解説。最強モデルでも41.2%しか解けない理由と、支配的な失敗モード「やり切らないリファクタリング」を読み解く。
103
·エージェント·★ 会員·論文·10分で読めます
論文解説: Macaron-V1 — 凍結ベース×LoRA混合で「出荷後も育つ」エージェントモデルを作る
Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
Mind Labのオープンエージェントモデル群Macaron-V1を論文本文から解説。凍結した744Bベースに4枚のLoRA専門家を重ねてターンごとに1枚選ぶMixture-of-LoRAと、モデル+ハーネスのペアを世代ごとに鍛える再帰的自己改善ループの中身を追う。
104
·エージェント·★ 会員·論文·10分で読めます
論文解説: Macaron-V1 — 凍結ベース×LoRA混合で「出荷後も育つ」エージェントモデルを作る
Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
Mind Labのオープンエージェントモデル群Macaron-V1を論文本文から解説。凍結した744Bベースに4枚のLoRA専門家を重ねてターンごとに1枚選ぶMixture-of-LoRAと、モデル+ハーネスのペアを世代ごとに鍛える再帰的自己改善ループの中身を追う。
105
·エージェント·★ 会員·論文·11分で読めます
論文解説: EnvACE — 環境まで自分で演じる「world rehearsal」がエージェントRLの環境不足を解く
EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
ツール実行環境を一切呼ばずに、LLM自身が「行動役」と「環境役」を交互に演じて強化学習する EnvACE を論文本文から解説。役割別GRPO、テスト時の脳内リハーサル、4ベンチマークでの結果と限界まで。
106
·エージェント·★ 会員·論文·11分で読めます
論文解説: EnvACE — 環境まで自分で演じる「world rehearsal」がエージェントRLの環境不足を解く
EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
ツール実行環境を一切呼ばずに、LLM自身が「行動役」と「環境役」を交互に演じて強化学習する EnvACE を論文本文から解説。役割別GRPO、テスト時の脳内リハーサル、4ベンチマークでの結果と限界まで。
107
·推論・高速化·★ 会員·論文·14分で読めます
論文解説: AgentOPSD — 「どのターンが勝敗を分けたか」をベイズ信念の再帰更新で見つけるエージェントRL
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
長いマルチターン対話の最後に成功/失敗しか教えてくれない環境で、「効いた一手」をどう見つけるか。自己蒸留のギャップをベイズ証拠と読み替え、log-odds空間で信念を再帰更新するAgentOPSDを論文本文から解説。ALFWorld 89.1%の結果、アブレーション、限界まで。
108
·エージェント·★ 会員·論文·11分で読めます
LLMエージェントを1から解説 — ツール使用とループの設計
ReAct: Synergizing Reasoning and Acting in Language Models
「考える→道具を使う→結果を見て考え直す」というループはどう設計されているのか。ReAct論文(Yao et al., 2022)の本文だけを根拠に、行動空間に言語を足すという発想、function callingの実装の形、実測された失敗モード(ループの暴走・幻覚したツール呼び出し)まで。
109
·エージェント·★ 会員·論文·11分で読めます
LLMエージェントを1から解説 — ツール使用とループの設計
ReAct: Synergizing Reasoning and Acting in Language Models
「考える→道具を使う→結果を見て考え直す」というループはどう設計されているのか。ReAct論文(Yao et al., 2022)の本文だけを根拠に、行動空間に言語を足すという発想、function callingの実装の形、実測された失敗モード(ループの暴走・幻覚したツール呼び出し)まで。