JA EN

#multimodal

17 記事

01 ·音声系·★ 会員·論文·18分で読めます 論文解説: Motion-Omni — 話しながら全身が動く、end-to-endの音声対話モデル Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue 返事の音声と全身のジェスチャーを、同じ推論の中で一度に生成する枠組み Motion-Omni を論文本文から解説。波形ではなく音声生成器の隠れ状態から動きを作る設計、そのために必要だった共適応と疑似ラベル、そして残った限界まで追う。 02 ·音声系·★ 会員·論文·12分で読めます 論文解説: Last Translation Benchmark — 「モデルが壊れる例」と検証ルールで翻訳を測り直す Last Translation Benchmark 機械翻訳のベンチマークは飽和し、自動指標も人手評価も信用しきれない。その袋小路に対し『先端モデルが壊れる例』を人手で集め、例ごとに手書きの検証ルールを添える——原題 Last Translation Benchmark を前提知識ゼロから読み解く。 03 ·★ 会員·論文·12分で読めます 論文解説: ピクセル文字表現学習の設計原則 — 文書を「読まずに見る」エンコーダは何で決まるか On the Design Fundamentals of Pixel Text Representation Learning 文字をコードに変換せず、画像のまま意味を掴むエンコーダ。その性能を決めるのはデータ量ではなく4つの設計原則だと示した EMNLP 2026 の論文を、前提知識ゼロから解説する。 04 ·★ 会員·論文·15分で読めます 論文解説: Puffin-World — 「上はどっちか」を覚えている世界モデル Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States 画像生成モデルに「重力の向き」を持たせると何が変わるのか。Puffin-World の Omni-Camera 表現と物理伝播を、前提知識ゼロから比喩・式・動く図で解説する。 05 ·エージェント·★ 会員·論文·19分で読めます 論文解説: UI-Venus-2 — 画面を見て操作するAIを、ベンチマークから実運用へ UI-Venus-2 Technical Report スマホ・ブラウザ・デスクトップを画面だけ見て操作するGUIエージェント UI-Venus-2 の技術報告書を、前提知識ゼロから解説。環境・タスク・検証を同時に広げる設計と、その限界までを論文本文だけを根拠に読む。 06 ·★ 会員·論文·21分で読めます 論文解説: VBVR-Pro — 「絵で考える」AIを、訓練でき・採点でき・比較できるようにした実験場 VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 画像や動画の生成そのものを「思考の場」として扱うネイティブ視覚推論。VBVR-Proは300個の手続き生成タスクと、VLM審判に頼らない決定論的な採点器を用意し、画像・動画・インターリーブ生成を同じ土俵で比較した。前提知識ゼロから読める解説。 07 ·RAG・検索拡張·★ 会員·論文·18分で読めます 論文解説: WeMM-Embedding — 文も画像も動画も「同じ物差し」に載せるWeChatの埋め込みモデル WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report テキスト・画像・動画・文書とその混合を1本のベクトルに落とすWeMM-Embedding(2B/4B/9B)のテクニカルレポートを解説。統一ペア形式、<embedding>トークン、マトリョーシカ次元、2段階学習と蒸留を、論文の数値だけで1から読み解く。 08 ·エージェント·★ 会員·論文·15分で読めます 論文解説: OmniScientist — 生データを直接「見る」AI科学者。36ケースを1つのエンジンで走らせる OmniScientist: An Omni-Modal Omni-Discipline AI Scientist 研究の全工程を自動化しても、AIが見ているのが「誰かが作った要約表」だけなら、たどり着ける発見は最初から限られる。生の波形・画像・3D点群を研究の全期間で直接観測させ、検問をPythonのコードで強制する OmniScientist を、36ケースの結果と地震波データの21.7%という発見まで論文本文から解説。 09 ·VLM・マルチモーダル·★ 会員·論文·10分で読めます VLMの成立と現在 — 視覚エンコーダとLLMをどう繋ぐか Learning Transferable Visual Models From Natural Language Supervision 画像を読めるLLM=VLMは「視覚エンコーダ+投影層+LLM」の3部品でできている。CLIPが架けた橋から、投影層の3流派、解像度戦略とトークン数の綱引き、実装で詰まる制約までを1から解説。 10 ·VLM・マルチモーダル·★ 会員·論文·10分で読めます VLMの成立と現在 — 視覚エンコーダとLLMをどう繋ぐか Learning Transferable Visual Models From Natural Language Supervision 画像を読めるLLM=VLMは「視覚エンコーダ+投影層+LLM」の3部品でできている。CLIPが架けた橋から、投影層の3流派、解像度戦略とトークン数の綱引き、実装で詰まる制約までを1から解説。 11 ·エージェント·★ 会員·論文·10分で読めます 論文解説: Video-DeepResearch — 動画を「見て、調べ尽くす」次世代マルチモーダル・エージェント Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent 動画から視覚的手がかりを拾い、Web検索で裏取りする「Video-DeepResearch」の論文を解説。既存モデルが視覚ツールを避ける「モダリティバイアス」と、記憶だけで答える「知識リーク」を、段階的ツール解禁とSFT+GRPOの2段階学習でどう克服したかを、一次資料に沿って読み解きます。 12 ·★ 会員·論文·13分で読めます 論文解説: マルチモーダル事前学習の『物理法則』— 知識はどのモダリティからどこへ流れるのか Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes テキストと画像を最初から1つのモデルで学ばせると何が起きるのか。Meta FAIRらの大規模な統制実験から、知識の非対称な流れ、シナジーが生まれる条件、『視覚の怠け』を防ぐ早期統一、そして生成データ5%で強い画像生成を成立させるレシピまでを読み解く。 13 ·エージェント·★ 会員·論文·11分で読めます 論文解説: Qwen-UI-Agent — スマホもPCも操る「実世界基準」のGUIエージェントはこう作られた Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents AlibabaのMAI-UIチームが公開したGUIエージェント基盤モデルのテクニカルレポートを解説。実機100台超での訓練、GUI+CLIの混成行動空間、100ターン超のオンラインRLで、実機ベンチ92.2%を叩き出した作り方を1から読み解く。 14 ·★ 会員·論文·11分で読めます 論文解説: Hunyuan3D-Buffalo 1.0 — 理解・生成・編集を1つの脳に束ねる3D統合マルチモーダルモデル Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing 3D形状を言葉で説明する・テキストから作る・指示で編集する・部品を切り出す——4つの仕事を1つのモデルで行うTencent HunyuanのHunyuan3D-Buffalo 1.0を論文本文から解説。87Mサンプルのデータ工場Nano3D-v2と、「生成力を鍛えると編集が上手くなる」という相乗効果の発見まで追う。 15 ·論文解説·★ 会員·論文·12分で読めます 論文解説: Alpamayo — 自動運転の推論モデル Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail NVIDIAの自動運転VLA「Alpamayo-R1」を原論文から読み解く。因果の鎖で推論を構造化するChain of Causationデータセット、flow matchingで99msに収めた軌道デコード、推論と行動のズレをRLで罰する3段階学習まで、1から解説する。 16 ·VLM・マルチモーダル·★ 会員·論文·9分で読めます 論文解説: CLIP — 言葉と画像を同じ地図に置く Learning Transferable Visual Models From Natural Language Supervision CLIP原論文(Radford et al., 2021)を本文だけを根拠に読む。バッチ内の正例と負例で学ぶ対照学習の仕組み、テキスト側が分類器の重みを作るというゼロショットの正体、プロンプトで5%動く事実、そして論文自身が並べた長い限界のリスト。 17 ·VLM・マルチモーダル·★ 会員·論文·9分で読めます 論文解説: CLIP — 言葉と画像を同じ地図に置く Learning Transferable Visual Models From Natural Language Supervision CLIP原論文(Radford et al., 2021)を本文だけを根拠に読む。バッチ内の正例と負例で学ぶ対照学習の仕組み、テキスト側が分類器の重みを作るというゼロショットの正体、プロンプトで5%動く事実、そして論文自身が並べた長い限界のリスト。