JA EN

#paper

15 記事

01 ·★ 会員·論文·17分で読めます 論文解説: Qwen-Drive-1.0 — VLMの形を変えずに、3D知覚と運転計画を「外付け」する Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving 事前学習済みVLMの構造を変えず、BEV知覚ヘッドとPlanning Expertを外付けするだけで3D検出・オキュパンシー・地図・軌跡生成を統合。汎用能力をほぼ落とさずNAVSIM PDMS 90.7を出した設計を、論文本文に沿って解説する。 02 ·★ 会員·論文·13分で読めます 論文解説: GigaBrain-0.7 — 3万7千時間の身体経験と「3つのシステム」で動くロボット基盤モデル GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture ロボット基盤モデルを「理解」「予測・評価」「行動」の3システムに分け、37,256.98時間の身体データで一段階事前学習する設計を、論文本文だけを根拠に1から解説する。未来画像と進捗値で方策を条件付ける仕組み、勾配を絞って流すSoft KI、実機での成功率まで。 03 ·エージェント·★ 会員·論文·18分で読めます 論文解説: Embodied-Navigator(TAMP-Nav) — VLMに「指を差させる」と、ナビゲーションは速く強くなる Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation 3D座標を出させる代わりにVLMへ2Dピクセルを「指差し」させ、考える場所と憶える場所を絞り、二段のGRPOで揃える。R2R-CEで成功率66.2%、1タスク16.58秒を9万本の軌跡だけで達成した設計を、論文本文に沿って1から解説する。 04 ·論文解説·★ 会員·論文·14分で読めます 論文解説: Apodex 1.1 — 「完了した仕事」を単位にエージェントをスケールさせる Apodex 1.1: Scaling Agentic Intelligence for Complex Work モデルを大きくするのでも推論時間を伸ばすのでもなく、「環境」と「協調」の2面をスケールさせる——Apodexチームの技術報告を、タスク契約の式からAgentOSの納品ゲート、数字と限界まで1から解説する。 05 ·エージェント·★ 会員·論文·21分で読めます 論文解説: Zetta ζ — 方策を凍結したまま、ロボットが実行中に自分を直す「閉ループ・ハーネス」 Zetta $ζ$: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence エピソードが終わってから反省する既存の身体エージェントに対し、Zettaは「コードで書かれた監視役」を行動と同じ頻度で回し、失敗の兆候が出た瞬間に介入する。方策の重みを一切触らずに成功率を押し上げた設計を、論文本文に沿って1から解説する。 06 ·エージェント·★ 会員·論文·17分で読めます 論文解説: StateM — モデルの重みを1gも動かさず、Terminal-Bench 2.1で95.3%・実行費15ドルへ StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling 長時間タスクのエージェントは、各ステップを解けるモデルを積んでいても落ちる。StateMは重みを触らず「実行の器」だけを鍛え、Terminal-Bench 2.1で95.3%、最終スコアのAPI費を574.68ドルから約15ドルへ下げたと報告する。ハーネススケーリングという賭けを1から解説する。 07 ·エージェント·★ 会員·論文·17分で読めます 論文解説: FACET — 指示・環境・解答・採点を「同じ実行状態」に接地させる課題合成 FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis ターミナル課題は「指示文・環境・模範解答・採点器」の4点セット。FACETは環境を先に建てて動かし、その実現済み状態を全部品の共通の地面にすることで整合を取る。7万件のスキルから6,078課題を作り、1.2Kの成功軌跡だけでQwen3.5を4B/9B/27Bとも底上げした論文を1から解説する。 08 ·エージェント·★ 会員·論文·12分で読めます 論文解説: EnvHarness — 練習場を作り直さず、外から「治具」をかぶせてエージェントを鍛える EnvHarness: Awakening Static Worlds for Agent Learning LLMエージェントの学習環境は手作りで静的、エージェントの弱点にも上達にも追随しない。EnvHarnessは環境の中身を書き換えずに外から挙動を作り替えるプラグイン層で、元の検証器はそのまま保つ。その設計と自動化役EnvRiggerを、前提知識ゼロから解く。 09 ·推論・高速化·★ 会員·論文·23分で読めます 論文解説: Agentic ESOpt — 逆伝播をやめて「モデルを揺らす」だけで、長丁場のLLMエージェントを鍛える Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements 勾配を一切計算せず、パラメータにノイズを足した分身をG体走らせて良かった方向へ寄せるだけ——推論と同じGPUメモリ(8.41GB)で27Bの全パラメータを更新し、15手必要な数独でGRPOに12.50ポイント差をつけたNUSらの論文を、1から解説する。 10 ·CNN・画像認識·★ 会員·論文·10分で読めます 論文解説: TurboVLA — LLMを追い出したロボット方策が、RTX 4090・VRAM 1GB未満で32Hzを叩き出す TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM 「画像→LLM→行動」が常識だったVLAから大規模言語モデルを外し、視覚と指示文を軽量クロスアテンションで直結。0.2Bパラメータ・31.2ms・0.9GB VRAMでLIBERO 97.7%を達成した設計を、論文本文に沿って1から解説する。 11 ·エージェント·★ 会員·論文·15分で読めます 論文解説: Recursive Synthesis — 検証済みタスクを「増築」して、長時間ターミナル課題を4万件量産する Recursive Synthesis for Long-Horizon Terminal Tasks 1件数百〜数千ドルかかる長時間ターミナルタスクを、検証済みの種から再帰的に増築して約$0.05で量産するRST。15ラウンドで37,484件、模範解答は中央値67行から374行へ難化し、その軌跡でQwen3.5をSFT+PPOで実際に強くした——Tencentらのデータ合成論文を1から解説する。 12 ·エージェント·★ 会員·論文·12分で読めます 論文解説: OSReward — AIの「採点者」は信用できるか。コンピュータ操作エージェントの報酬を測り直す OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models PCやスマホを操作するAIエージェントの成否を判定する「VLM審判」は、実は失敗を成功と誤認する甘さバイアスを共有していた——1019本の人手検証済み軌跡でこれを暴き、30〜60倍安い公開報酬モデルOS-Shepherdで埋める論文を、前提知識ゼロから解説する。 13 ·エージェント·★ 会員·論文·11分で読めます 論文解説: Metis — 記憶を外付けせず、モデルの中に住まわせる「Memory Foundation Model」 Metis: Memory Foundation Model AIエージェントの記憶は今もRAGなどの「外付け」が主流。この論文は記憶をモデル本体の順伝播に内蔵する Memory Foundation Model を提唱し、初のプロトタイプ Metis を提案する。覚える・忘れる・更新するを勾配なしのforward計算だけで実行する仕組みと、その実力・限界を1から解説。 14 ·エージェント·★ 会員·論文·10分で読めます 論文解説: LongHorizon-Harness — 長時間タスクは「実行」ではなく「状態管理」で解く LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks モデルを一切変えずに、タスク状態を実行の外に置き「管理→実行→監査」のループで回すだけで、長時間タスクの成績が大きく伸びる——Alibaba DreamXチームのハーネス設計論文を、比喩と擬似コードで1から解説する。 15 ·論文解説·★ 会員·論文·11分で読めます 論文解説: AskChem — 検索の単位を「論文」から「出典付きクレーム」に変える文献インフラ AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis 化学文献の検索単位を論文からDOI+原文引用つきの「クレーム」に変えたNYU発のインフラ論文を解説。240万クレームの索引・証拠グラフ・ハイブリッド検索の設計と、DOI捏造を88.3%→100%解決に変えた評価、そして限界までを1から読む。