JA EN

#navigation

2 記事

01 ·エージェント·★ 会員·論文·13分で読めます 論文解説 UrbanGround: 街に降ろされたMLLMエージェントは、どこで崩れるのか UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 香港の全域3D地理データから作った実スケールの街に、MLLMエージェントを一人称で降ろす。視覚認識は9割、方位理解は4割、長距離ナビはほぼ0%。「見える」と「動ける」の断絶を測ったベンチマーク論文を1から解説する。 02 ·エージェント·★ 会員·論文·18分で読めます 論文解説: Embodied-Navigator(TAMP-Nav) — VLMに「指を差させる」と、ナビゲーションは速く強くなる Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation 3D座標を出させる代わりにVLMへ2Dピクセルを「指差し」させ、考える場所と憶える場所を絞り、二段のGRPOで揃える。R2R-CEで成功率66.2%、1タスク16.58秒を9万本の軌跡だけで達成した設計を、論文本文に沿って1から解説する。