JA EN

#cross-attention

2 記事

01 ·★ 会員·論文·21分で読めます 論文解説 The Missing Temporal Link — 台本の「時刻」を映像と音声の時間軸に載せるTemporal Context Routing The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation 映像と音声は互いに同期しているのに、台本の指定時刻からは2人そろってずれる — この見落とされた3本目の時間軸を、クロスアテンションのロジットに足す1本の式だけで埋めたTCRを、原論文の式と実験値に沿って1から解説する。 02 ·CNN・画像認識·★ 会員·論文·10分で読めます 論文解説: TurboVLA — LLMを追い出したロボット方策が、RTX 4090・VRAM 1GB未満で32Hzを叩き出す TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM 「画像→LLM→行動」が常識だったVLAから大規模言語モデルを外し、視覚と指示文を軽量クロスアテンションで直結。0.2Bパラメータ・31.2ms・0.9GB VRAMでLIBERO 97.7%を達成した設計を、論文本文に沿って1から解説する。