JA EN

#robotics

7 記事

01 ·論文解説·★ 会員·論文·15分で読めます 論文解説 RoboTok — ネット動画から「手の動きが似た手本」を掘り出すデータエンジン RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning ネット上の人間の動画から「手の動きが似ている手本」だけを引き当てるデータエンジン RoboTok(arXiv:2609.03199)を、前提知識ゼロから解説。DTWで似た動きを定義し、その順位を埋め込みに蒸留して内積検索に落とす設計と、実験結果・限界までを追う。 02 ·エージェント·★ 会員·論文·16分で読めます 論文解説: ZimaBlue — 12万時間の一人称動画でロボットを汎化させる ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training 行動ラベルのない一人称動画12万時間をロボット制御に変換する World Action Model の論文を1から解説。3段階カリキュラム・100次元の統一行動表現・Slow-Fast の非同期二系統で、実機ゼロショット36.1%→77.8%、制御周期33msに至るまで。 03 ·★ 会員·論文·14分で読めます 論文解説: Beyond Data Scaling — ロボット基盤モデルは「データ量」より「表現」で決まる(VLAct) Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models ロボットの軌跡データはWebのように集められない。ならば限られた軌跡から「使い回せる表現」を絞り出すべきだ、という主張の論文。VLM事前分布の保護・複数ヘッド同時監督・身体をまたいだ部分統一の3点で、16GPU・全部オープンデータのまま産業系VLAを上回った。 04 ·推論・高速化·★ 会員·論文·12分で読めます 論文解説 WarpSAC: 強化学習の「安定化装置」は、データが潤沢になると足枷に変わる WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation GPU並列シミュレータで経験データが桁違いに増えると、SACの正規化やclipped double-Qといった「安定化装置」は助けから足枷に変わる。論文は3本の軸を切り分け、データ状況に応じて安定化装置を外すという処方箋(WarpSAC)を示した。 05 ·★ 会員·論文·13分で読めます 論文解説: GigaBrain-0.7 — 3万7千時間の身体経験と「3つのシステム」で動くロボット基盤モデル GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture ロボット基盤モデルを「理解」「予測・評価」「行動」の3システムに分け、37,256.98時間の身体データで一段階事前学習する設計を、論文本文だけを根拠に1から解説する。未来画像と進捗値で方策を条件付ける仕組み、勾配を絞って流すSoft KI、実機での成功率まで。 06 ·エージェント·★ 会員·論文·21分で読めます 論文解説: Zetta ζ — 方策を凍結したまま、ロボットが実行中に自分を直す「閉ループ・ハーネス」 Zetta $ζ$: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence エピソードが終わってから反省する既存の身体エージェントに対し、Zettaは「コードで書かれた監視役」を行動と同じ頻度で回し、失敗の兆候が出た瞬間に介入する。方策の重みを一切触らずに成功率を押し上げた設計を、論文本文に沿って1から解説する。 07 ·CNN・画像認識·★ 会員·論文·10分で読めます 論文解説: TurboVLA — LLMを追い出したロボット方策が、RTX 4090・VRAM 1GB未満で32Hzを叩き出す TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM 「画像→LLM→行動」が常識だったVLAから大規模言語モデルを外し、視覚と指示文を軽量クロスアテンションで直結。0.2Bパラメータ・31.2ms・0.9GB VRAMでLIBERO 97.7%を達成した設計を、論文本文に沿って1から解説する。