PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#mllm
3 記事
01
2026-09-08
·
★ 会員
·
論文
·
14分で読めます
論文解説 Beyond Retrieval — 取り出した映像を「潜在メモリ」に取り込むLatentStream
Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding
流れ続ける動画に対し、過去の証拠を外部コンテキストとして足すのではなく、固定長の潜在メモリトークンへ内面化する枠組みLatentStream。階層メモリ・潜在メモリ進化・自信ベースのテスト時最適化を、論文本文に沿って1から解説する。
02
2026-09-03
·
エージェント
·
★ 会員
·
論文
·
13分で読めます
論文解説 UrbanGround: 街に降ろされたMLLMエージェントは、どこで崩れるのか
UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City
香港の全域3D地理データから作った実スケールの街に、MLLMエージェントを一人称で降ろす。視覚認識は9割、方位理解は4割、長距離ナビはほぼ0%。「見える」と「動ける」の断絶を測ったベンチマーク論文を1から解説する。
03
2026-08-20
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
10分で読めます
論文解説: 危機映像のAI捏造は見抜けるか — RA-Benchが暴いた検出器の実力
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination
実在の災害・戦争映像の1コマ目から作らせたAI動画1万6千本で、検出器7種・ゼロショットのマルチモーダルモデル10種・専用ファインチューン2種を測ったら、どれも生成元をまたいで汎化しなかった。映像ではなくタイムスタンプを読んでいたモデル、SNS加工で検出率が1.4%まで落ちる話まで、論文本文から解説。