JA EN

#mllm

3 記事

01 ·★ 会員·論文·14分で読めます 論文解説 Beyond Retrieval — 取り出した映像を「潜在メモリ」に取り込むLatentStream Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 流れ続ける動画に対し、過去の証拠を外部コンテキストとして足すのではなく、固定長の潜在メモリトークンへ内面化する枠組みLatentStream。階層メモリ・潜在メモリ進化・自信ベースのテスト時最適化を、論文本文に沿って1から解説する。 02 ·エージェント·★ 会員·論文·13分で読めます 論文解説 UrbanGround: 街に降ろされたMLLMエージェントは、どこで崩れるのか UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 香港の全域3D地理データから作った実スケールの街に、MLLMエージェントを一人称で降ろす。視覚認識は9割、方位理解は4割、長距離ナビはほぼ0%。「見える」と「動ける」の断絶を測ったベンチマーク論文を1から解説する。 03 ·LLM — 大規模言語モデル·★ 会員·論文·10分で読めます 論文解説: 危機映像のAI捏造は見抜けるか — RA-Benchが暴いた検出器の実力 Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination 実在の災害・戦争映像の1コマ目から作らせたAI動画1万6千本で、検出器7種・ゼロショットのマルチモーダルモデル10種・専用ファインチューン2種を測ったら、どれも生成元をまたいで汎化しなかった。映像ではなくタイムスタンプを読んでいたモデル、SNS加工で検出率が1.4%まで落ちる話まで、論文本文から解説。