JA EN

#memory

6 記事

01 ·★ 会員·論文·14分で読めます 論文解説 Beyond Retrieval — 取り出した映像を「潜在メモリ」に取り込むLatentStream Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 流れ続ける動画に対し、過去の証拠を外部コンテキストとして足すのではなく、固定長の潜在メモリトークンへ内面化する枠組みLatentStream。階層メモリ・潜在メモリ進化・自信ベースのテスト時最適化を、論文本文に沿って1から解説する。 02 ·推論・高速化·★ 会員·論文·18分で読めます 論文解説: LatentPress — 圧縮した文脈を、テキストにも画像にも戻さずLLMに直接読ませる LatentPress: Context Compression Beyond Text and Vision 長い会話履歴や文書を「テキストの要約」でも「画像」でもなく、凍結したLLMがそのまま読める連続ベクトル(ソフトトークン)に書き込む手法。LongMemEvalで7.70倍圧縮しながら非圧縮を上回った論文を、前提知識ゼロから解説する。 03 ·音声系·★ 会員·論文·21分で読めます 論文解説: VoiceMem — 音声対話に「左脳と右脳」の記憶を、遅延ゼロで VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction リアルタイム音声対話に記憶を持たせるVoiceMemを1から解説。事実を扱う「左脳」と人柄・感情を扱う「右脳」を並列に置き、VADが待つ無音の中に検索を隠すことで、top-5という極小の予算のまま精度を上げる仕組みを読み解く。 04 ·エージェント·★ 会員·論文·18分で読めます 論文解説: Embodied-Navigator(TAMP-Nav) — VLMに「指を差させる」と、ナビゲーションは速く強くなる Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation 3D座標を出させる代わりにVLMへ2Dピクセルを「指差し」させ、考える場所と憶える場所を絞り、二段のGRPOで揃える。R2R-CEで成功率66.2%、1タスク16.58秒を9万本の軌跡だけで達成した設計を、論文本文に沿って1から解説する。 05 ·エージェント·★ 会員·論文·14分で読めます エージェントの記憶設計 — 短期・長期・エピソード MemGPT: Towards LLMs as Operating Systems LLMは何も覚えていません。会話が続いて見えるのは毎ターン全履歴を読み直させているからです。短期・エピソード・長期の3層に分ける設計、想起を決める式、そして最も設計されていない「忘れる」まで、前提知識ゼロから組み立てます。 06 ·エージェント·★ 会員·論文·11分で読めます 論文解説: Metis — 記憶を外付けせず、モデルの中に住まわせる「Memory Foundation Model」 Metis: Memory Foundation Model AIエージェントの記憶は今もRAGなどの「外付け」が主流。この論文は記憶をモデル本体の順伝播に内蔵する Memory Foundation Model を提唱し、初のプロトタイプ Metis を提案する。覚える・忘れる・更新するを勾配なしのforward計算だけで実行する仕組みと、その実力・限界を1から解説。