JA EN

#asr

9 記事

01 ·音声系·★ 会員·論文·18分で読めます 論文解説: Motion-Omni — 話しながら全身が動く、end-to-endの音声対話モデル Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue 返事の音声と全身のジェスチャーを、同じ推論の中で一度に生成する枠組み Motion-Omni を論文本文から解説。波形ではなく音声生成器の隠れ状態から動きを作る設計、そのために必要だった共適応と疑似ラベル、そして残った限界まで追う。 02 ·音声系·★ 会員·論文·12分で読めます 論文解説: Last Translation Benchmark — 「モデルが壊れる例」と検証ルールで翻訳を測り直す Last Translation Benchmark 機械翻訳のベンチマークは飽和し、自動指標も人手評価も信用しきれない。その袋小路に対し『先端モデルが壊れる例』を人手で集め、例ごとに手書きの検証ルールを添える——原題 Last Translation Benchmark を前提知識ゼロから読み解く。 03 ·音声系·★ 会員·論文·21分で読めます 論文解説: VoiceMem — 音声対話に「左脳と右脳」の記憶を、遅延ゼロで VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction リアルタイム音声対話に記憶を持たせるVoiceMemを1から解説。事実を扱う「左脳」と人柄・感情を扱う「右脳」を並列に置き、VADが待つ無音の中に検索を隠すことで、top-5という極小の予算のまま精度を上げる仕組みを読み解く。 04 ·★ 会員·論文·14分で読めます 論文解説: TLive-Omni — ライブ配信を「見て・聞いて・何分何秒かまで答える」オムニモーダルモデル TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming ECライブ配信に特化したオムニモーダル理解モデルTLive-Omniを、前提知識ゼロから解説。時刻つきで映像と音を隣に置くPer-vGrid、3段階SFT、思考の跡ではなく答えの忠実さに報酬を出すFaithful-RFTまでを、論文の数値だけを根拠に読み解く。 05 ·音声系·無料·14分で読めます 音声認識を1から — 波形からテキストまで マイクが拾う数字の列がどうやって文字になるのかを前提知識ゼロから。スペクトログラムによる特徴抽出、アラインメント問題を解いたCTC、自己回帰デコーダのencoder-decoder、そしてWhisperまでを歴史の順に追う。 06 ·音声系·★ 会員·論文·13分で読めます 論文解説: SwanTale — 参照音声なしで「言葉から声をデザインする」統合音声・オーディオ生成 SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks ByteDanceのSwanTaleは、参照音声から声を写すzero-shot TTSと、自然言語キャプションだけで声・環境音・効果音まで一体生成するinstructタスクを1つのモデルで実現した。7000万件のキャプションデータ基盤SwanData-CaptionからUnified MoE、GRPO後訓練まで、論文本文に沿って読み解く。 07 ·音声系·★ 会員·論文·11分で読めます 論文解説: Interpretable MEG Decoding of Perceived Speech — 脳磁図から「聞いた音声」を当てるAIの中身を、脳地図として読む Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval 脳磁図(MEG)3秒分から、その人が聞いていた音声を1005候補中39.75%で言い当てる——しかも学習済みの重みを大脳皮質の「どこ」と「どんなリズム」に翻訳でき、遮蔽実験で「何を手がかりにしたか」まで特定できるデコーダの論文を、1から解説する。 08 ·音声系·★ 会員·論文·9分で読めます 論文解説: Whisperはなぜ頑健なのか — 大規模弱教師あり学習 Robust Speech Recognition via Large-Scale Weak Supervision Whisper原論文(Radford et al., 2022)を本文だけを根拠に読む。波形からログメルスペクトログラムへ、そしてencoder-decoderで直接テキストを出す設計。68万時間という規模が「ファインチューニングなしで頑健」をどう生んだのか、論文が実際に測った数字と、論文自身が認めた限界まで。 09 ·音声系·★ 会員·論文·9分で読めます 論文解説: Whisperはなぜ頑健なのか — 大規模弱教師あり学習 Robust Speech Recognition via Large-Scale Weak Supervision Whisper原論文(Radford et al., 2022)を本文だけを根拠に読む。波形からログメルスペクトログラムへ、そしてencoder-decoderで直接テキストを出す設計。68万時間という規模が「ファインチューニングなしで頑健」をどう生んだのか、論文が実際に測った数字と、論文自身が認めた限界まで。