PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#robotics
7 記事
01
2026-09-06
·
論文解説
·
★ 会員
·
論文
·
15分で読めます
論文解説 RoboTok — ネット動画から「手の動きが似た手本」を掘り出すデータエンジン
RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning
ネット上の人間の動画から「手の動きが似ている手本」だけを引き当てるデータエンジン RoboTok(arXiv:2609.03199)を、前提知識ゼロから解説。DTWで似た動きを定義し、その順位を埋め込みに蒸留して内積検索に落とす設計と、実験結果・限界までを追う。
02
2026-09-03
·
エージェント
·
★ 会員
·
論文
·
16分で読めます
論文解説: ZimaBlue — 12万時間の一人称動画でロボットを汎化させる
ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training
行動ラベルのない一人称動画12万時間をロボット制御に変換する World Action Model の論文を1から解説。3段階カリキュラム・100次元の統一行動表現・Slow-Fast の非同期二系統で、実機ゼロショット36.1%→77.8%、制御周期33msに至るまで。
03
2026-09-01
·
★ 会員
·
論文
·
14分で読めます
論文解説: Beyond Data Scaling — ロボット基盤モデルは「データ量」より「表現」で決まる(VLAct)
Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
ロボットの軌跡データはWebのように集められない。ならば限られた軌跡から「使い回せる表現」を絞り出すべきだ、という主張の論文。VLM事前分布の保護・複数ヘッド同時監督・身体をまたいだ部分統一の3点で、16GPU・全部オープンデータのまま産業系VLAを上回った。
04
2026-08-29
·
推論・高速化
·
★ 会員
·
論文
·
12分で読めます
論文解説 WarpSAC: 強化学習の「安定化装置」は、データが潤沢になると足枷に変わる
WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
GPU並列シミュレータで経験データが桁違いに増えると、SACの正規化やclipped double-Qといった「安定化装置」は助けから足枷に変わる。論文は3本の軸を切り分け、データ状況に応じて安定化装置を外すという処方箋(WarpSAC)を示した。
05
2026-08-27
·
★ 会員
·
論文
·
13分で読めます
論文解説: GigaBrain-0.7 — 3万7千時間の身体経験と「3つのシステム」で動くロボット基盤モデル
GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
ロボット基盤モデルを「理解」「予測・評価」「行動」の3システムに分け、37,256.98時間の身体データで一段階事前学習する設計を、論文本文だけを根拠に1から解説する。未来画像と進捗値で方策を条件付ける仕組み、勾配を絞って流すSoft KI、実機での成功率まで。
06
2026-08-22
·
エージェント
·
★ 会員
·
論文
·
21分で読めます
論文解説: Zetta ζ — 方策を凍結したまま、ロボットが実行中に自分を直す「閉ループ・ハーネス」
Zetta $ζ$: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
エピソードが終わってから反省する既存の身体エージェントに対し、Zettaは「コードで書かれた監視役」を行動と同じ頻度で回し、失敗の兆候が出た瞬間に介入する。方策の重みを一切触らずに成功率を押し上げた設計を、論文本文に沿って1から解説する。
07
2026-08-13
·
CNN・画像認識
·
★ 会員
·
論文
·
10分で読めます
論文解説: TurboVLA — LLMを追い出したロボット方策が、RTX 4090・VRAM 1GB未満で32Hzを叩き出す
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
「画像→LLM→行動」が常識だったVLAから大規模言語モデルを外し、視覚と指示文を軽量クロスアテンションで直結。0.2Bパラメータ・31.2ms・0.9GB VRAMでLIBERO 97.7%を達成した設計を、論文本文に沿って1から解説する。