JA EN

#video

3 記事

01 ·VLM・マルチモーダル·★ 会員·論文·10分で読めます 動画理解を1から — フレームの束から時間の理解へ Is Space-Time Attention All You Need for Video Understanding? (TimeSformer) 動画は「画像がたくさん」ではない。何枚をどう選ぶか(サンプリング)、フレーム同士をどう混ぜるか(時間注意)、長い動画をどう縮めるか(圧縮)の3つの問いに分けて、前提知識ゼロから式・動く図・コードで解説する。 02 ·エージェント·★ 会員·論文·10分で読めます 論文解説: Video-DeepResearch — 動画を「見て、調べ尽くす」次世代マルチモーダル・エージェント Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent 動画から視覚的手がかりを拾い、Web検索で裏取りする「Video-DeepResearch」の論文を解説。既存モデルが視覚ツールを避ける「モダリティバイアス」と、記憶だけで答える「知識リーク」を、段階的ツール解禁とSFT+GRPOの2段階学習でどう克服したかを、一次資料に沿って読み解きます。 03 ·動画圧縮·★ 会員·10分で読めます 動画圧縮を1から — 動き補償とGOP 1秒30枚の写真を別々に圧縮していては、いまの配信帯域にはまるで届きません。フレーム差分がなぜ破綻するのか、動き補償は何を送っているのか、I/P/BフレームとGOP、CBR・VBR・CRFが何を一定に保つのか。最後は配信担当が実際に決めるキーフレーム間隔まで降りていきます。