JA EN

#video-understanding

3 記事

01 ·★ 会員·論文·14分で読めます 論文解説 Beyond Retrieval — 取り出した映像を「潜在メモリ」に取り込むLatentStream Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 流れ続ける動画に対し、過去の証拠を外部コンテキストとして足すのではなく、固定長の潜在メモリトークンへ内面化する枠組みLatentStream。階層メモリ・潜在メモリ進化・自信ベースのテスト時最適化を、論文本文に沿って1から解説する。 02 ·★ 会員·論文·14分で読めます 論文解説: TLive-Omni — ライブ配信を「見て・聞いて・何分何秒かまで答える」オムニモーダルモデル TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming ECライブ配信に特化したオムニモーダル理解モデルTLive-Omniを、前提知識ゼロから解説。時刻つきで映像と音を隣に置くPer-vGrid、3段階SFT、思考の跡ではなく答えの忠実さに報酬を出すFaithful-RFTまでを、論文の数値だけを根拠に読み解く。 03 ·★ 会員·論文·10分で読めます 論文解説: GST-Bench — VLMは動画から「空間の全体像」を掴めるか GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? 部屋を一周した動画を見せたあと「いま君がいる場所から、さっきのソファはどっち?」と聞くと、最強のVLMでも人間の半分ほどしか答えられない——ByteDance SeedらのGST-Benchを論文本文から解説。ズルを封じるベンチマーク設計、22モデルの結果、そして訓練データで27点伸びた話まで。