JA EN

#speech

5 記事

01 ·音声系·★ 会員·論文·21分で読めます 論文解説: VoiceMem — 音声対話に「左脳と右脳」の記憶を、遅延ゼロで VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction リアルタイム音声対話に記憶を持たせるVoiceMemを1から解説。事実を扱う「左脳」と人柄・感情を扱う「右脳」を並列に置き、VADが待つ無音の中に検索を隠すことで、top-5という極小の予算のまま精度を上げる仕組みを読み解く。 02 ·音声系·★ 会員·論文·17分で読めます 音の表現 — メルスペクトログラムとトークン化 Robust Speech Recognition via Large-Scale Weak Supervision 音声モデルが波形をそのまま食べない理由から出発し、短時間フーリエ変換 → メル目盛り → 対数 → 離散トークンという変換の連鎖を前提知識ゼロで解説。窓長のトレードオフ、MFCCがDCTを捨てた事情、音響トークンと意味トークンの違い、そして設定を1つ間違えるだけで音が壊れる現場の落とし穴まで。 03 ·音声系·★ 会員·論文·17分で読めます 音の表現 — メルスペクトログラムとトークン化 Robust Speech Recognition via Large-Scale Weak Supervision 音声モデルが波形をそのまま食べない理由から出発し、短時間フーリエ変換 → メル目盛り → 対数 → 離散トークンという変換の連鎖を前提知識ゼロで解説。窓長のトレードオフ、MFCCがDCTを捨てた事情、音響トークンと意味トークンの違い、そして設定を1つ間違えるだけで音が壊れる現場の落とし穴まで。 04 ·音声系·★ 会員·論文·14分で読めます 音声合成を1から — テキストから声まで WaveNet: A Generative Model for Raw Audio 数文字のテキストから、その数万倍の長さの波形をでっちあげる——それが音声合成です。素直な回帰がなぜ破綻するのか(一対多と位相)、なぜテキスト→メルスペクトログラム→波形の二段構えが定番になったのか、そして数秒の参照音声で声色が移る仕組みまでを前提知識ゼロから解説します。 05 ·音声系·無料·14分で読めます 音声認識を1から — 波形からテキストまで マイクが拾う数字の列がどうやって文字になるのかを前提知識ゼロから。スペクトログラムによる特徴抽出、アラインメント問題を解いたCTC、自己回帰デコーダのencoder-decoder、そしてWhisperまでを歴史の順に追う。