JA EN

#tts

2 記事

01 ·音声系·★ 会員·論文·14分で読めます 音声合成を1から — テキストから声まで WaveNet: A Generative Model for Raw Audio 数文字のテキストから、その数万倍の長さの波形をでっちあげる——それが音声合成です。素直な回帰がなぜ破綻するのか(一対多と位相)、なぜテキスト→メルスペクトログラム→波形の二段構えが定番になったのか、そして数秒の参照音声で声色が移る仕組みまでを前提知識ゼロから解説します。 02 ·音声系·★ 会員·論文·13分で読めます 論文解説: SwanTale — 参照音声なしで「言葉から声をデザインする」統合音声・オーディオ生成 SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks ByteDanceのSwanTaleは、参照音声から声を写すzero-shot TTSと、自然言語キャプションだけで声・環境音・効果音まで一体生成するinstructタスクを1つのモデルで実現した。7000万件のキャプションデータ基盤SwanData-CaptionからUnified MoE、GRPO後訓練まで、論文本文に沿って読み解く。