PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#video-understanding
3 記事
01
2026-09-08
·
★ 会員
·
論文
·
14分で読めます
論文解説 Beyond Retrieval — 取り出した映像を「潜在メモリ」に取り込むLatentStream
Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding
流れ続ける動画に対し、過去の証拠を外部コンテキストとして足すのではなく、固定長の潜在メモリトークンへ内面化する枠組みLatentStream。階層メモリ・潜在メモリ進化・自信ベースのテスト時最適化を、論文本文に沿って1から解説する。
02
2026-08-27
·
★ 会員
·
論文
·
14分で読めます
論文解説: TLive-Omni — ライブ配信を「見て・聞いて・何分何秒かまで答える」オムニモーダルモデル
TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming
ECライブ配信に特化したオムニモーダル理解モデルTLive-Omniを、前提知識ゼロから解説。時刻つきで映像と音を隣に置くPer-vGrid、3段階SFT、思考の跡ではなく答えの忠実さに報酬を出すFaithful-RFTまでを、論文の数値だけを根拠に読み解く。
03
2026-08-13
·
★ 会員
·
論文
·
10分で読めます
論文解説: GST-Bench — VLMは動画から「空間の全体像」を掴めるか
GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
部屋を一周した動画を見せたあと「いま君がいる場所から、さっきのソファはどっち?」と聞くと、最強のVLMでも人間の半分ほどしか答えられない——ByteDance SeedらのGST-Benchを論文本文から解説。ズルを封じるベンチマーク設計、22モデルの結果、そして訓練データで27点伸びた話まで。