PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#speech-synthesis
2 記事
01
2026-08-26
·
音声系
·
★ 会員
·
論文
·
14分で読めます
音声合成を1から — テキストから声まで
WaveNet: A Generative Model for Raw Audio
数文字のテキストから、その数万倍の長さの波形をでっちあげる——それが音声合成です。素直な回帰がなぜ破綻するのか(一対多と位相)、なぜテキスト→メルスペクトログラム→波形の二段構えが定番になったのか、そして数秒の参照音声で声色が移る仕組みまでを前提知識ゼロから解説します。
02
2026-08-13
·
音声系
·
★ 会員
·
論文
·
13分で読めます
論文解説: SwanTale — 参照音声なしで「言葉から声をデザインする」統合音声・オーディオ生成
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
ByteDanceのSwanTaleは、参照音声から声を写すzero-shot TTSと、自然言語キャプションだけで声・環境音・効果音まで一体生成するinstructタスクを1つのモデルで実現した。7000万件のキャプションデータ基盤SwanData-CaptionからUnified MoE、GRPO後訓練まで、論文本文に沿って読み解く。