JA EN

#spatial-reasoning

2 記事

01 ·エージェント·★ 会員·論文·13分で読めます 論文解説 UrbanGround: 街に降ろされたMLLMエージェントは、どこで崩れるのか UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 香港の全域3D地理データから作った実スケールの街に、MLLMエージェントを一人称で降ろす。視覚認識は9割、方位理解は4割、長距離ナビはほぼ0%。「見える」と「動ける」の断絶を測ったベンチマーク論文を1から解説する。 02 ·★ 会員·論文·10分で読めます 論文解説: GST-Bench — VLMは動画から「空間の全体像」を掴めるか GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? 部屋を一周した動画を見せたあと「いま君がいる場所から、さっきのソファはどっち?」と聞くと、最強のVLMでも人間の半分ほどしか答えられない——ByteDance SeedらのGST-Benchを論文本文から解説。ズルを封じるベンチマーク設計、22モデルの結果、そして訓練データで27点伸びた話まで。