PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#video
3 記事
01
2026-08-27
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
10分で読めます
動画理解を1から — フレームの束から時間の理解へ
Is Space-Time Attention All You Need for Video Understanding? (TimeSformer)
動画は「画像がたくさん」ではない。何枚をどう選ぶか(サンプリング)、フレーム同士をどう混ぜるか(時間注意)、長い動画をどう縮めるか(圧縮)の3つの問いに分けて、前提知識ゼロから式・動く図・コードで解説する。
02
2026-08-13
·
エージェント
·
★ 会員
·
論文
·
10分で読めます
論文解説: Video-DeepResearch — 動画を「見て、調べ尽くす」次世代マルチモーダル・エージェント
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
動画から視覚的手がかりを拾い、Web検索で裏取りする「Video-DeepResearch」の論文を解説。既存モデルが視覚ツールを避ける「モダリティバイアス」と、記憶だけで答える「知識リーク」を、段階的ツール解禁とSFT+GRPOの2段階学習でどう克服したかを、一次資料に沿って読み解きます。
03
2026-08-05
·
動画圧縮
·
★ 会員
·
10分で読めます
動画圧縮を1から — 動き補償とGOP
1秒30枚の写真を別々に圧縮していては、いまの配信帯域にはまるで届きません。フレーム差分がなぜ破綻するのか、動き補償は何を送っているのか、I/P/BフレームとGOP、CBR・VBR・CRFが何を一定に保つのか。最後は配信担当が実際に決めるキーフレーム間隔まで降りていきます。