JA EN

#temporal-attention

1 記事

01 ·VLM・マルチモーダル·★ 会員·論文·10分で読めます 動画理解を1から — フレームの束から時間の理解へ Is Space-Time Attention All You Need for Video Understanding? (TimeSformer) 動画は「画像がたくさん」ではない。何枚をどう選ぶか(サンプリング)、フレーム同士をどう混ぜるか(時間注意)、長い動画をどう縮めるか(圧縮)の3つの問いに分けて、前提知識ゼロから式・動く図・コードで解説する。