論文解説: SwanTale — 参照音声なしで「言葉から声をデザインする」統合音声・オーディオ生成
ByteDanceのSwanTaleは、参照音声から声を写すzero-shot TTSと、自然言語キャプションだけで声・環境音・効果音まで一体生成するinstructタスクを1つのモデルで実現した。7000万件のキャプションデータ基盤SwanData-CaptionからUnified MoE、GRPO後訓練まで、論文本文に沿って読み解く。
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
一次資料 — この記事の根拠
論文の発表 2026-08-03→この解説の公開 2026-08-13同月
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot TasksYu Zhang, Ruiqi Li, Changhao Pan ほか · 2026-08-03 · v2arXiv:2608.02023論文ページ·PDF原文の要旨(Abstract)を読む
Speech and audio generation is often needed in animation dubbing, audio drama, movies, advertising, games, podcasts, and short-video production. In these scenarios, creators may need to design voices without reference recordings, control speaker styles with natural language, support acoustic scenes with environments and audio effects, and later reuse the designed voices. Therefore, it is important to support multi-speaker speech and audio generation for both instruct and zero-shot tasks. The instruct task requires a caption of the environment, speaker styles, and fine-grained content, while the zero-shot task uses reference audio together with the same fine-grained content. We address these tasks from both the data and model sides. First, we propose SwanData-Caption, which cleans raw speech and audio data, adds targeted synthetic coverage, and annotates diverse and accurate multi-level captions. Then, we propose SwanTale, a multi-speaker expressive speech and audio generation model that supports both zero-shot and instruct tasks. We introduce SwanVAE to support high-quality multi-audio-modality generation. Then, we adopt reward-conditioned quality control and Engram conditioning, along with Unified MoE for multi-task and multi-audio-modality modeling. In addition, we use curriculum learning and GRPO post-training to let the model progressively learn and strengthen its capabilities. Experimental results show that SwanTale leads on multiple key zero-shot and instruct metrics, achieves the best expressiveness scores in both tasks, and supports complex instruct generation involving multi-speaker speech and audio. Demos can be found at https://swanaigc.github.io/#swantale.
「声優がいない録音現場」という問題
アニメの吹き替え、オーディオドラマ、広告、ゲーム、ポッドキャスト。音声を作る現場では、「この声で読んでほしい」というお手本の録音が最初からあるとは限りません。論文の言葉を借りれば、メディア制作はむしろ逆から始まります (§1)。キャラクターに合う声をゼロから設計し、演じ方を言葉で指定し、そのセリフを雨音や街の喧騒といった「音の風景」の中に置く。そして一度デザインした声は後から使い回したい。
従来のzero-shot TTS(数秒の参照音声を渡すと、同じ声で新しい内容を合成する技術)は「声がすでにある」場合しか扱えません。一方、自然言語の指示で声を作るinstruct TTSもありますが、論文では既存システムの多くは音声しか生成できないと指摘されます。環境音や効果音を別パイプラインで後付けすると、1つ1つはもっともらしくても、タイミング・音量・残響が音声とずれてしまうのです (§1)。
SwanTale(ByteDanceのテクニカルレポート)は、この2つ——参照音声から声を写すzero-shotと、キャプションだけで声も音響シーンも作るinstruct——を1つのモデルで扱う、複数話者対応の音声・オーディオ統合生成モデルです。
2つのタスクと、立ちはだかる3つの壁
論文は入力の違いをこう整理します (§1)。
- instructタスク: 環境(場所、残響、持続的な背景音)・話者スタイル(性別や年齢だけでなくペルソナ、声質、話し癖)・細粒度の内容(感情の変化、強調、局所的な効果音)を記したキャプションが入力
- zero-shotタスク: 参照音声 + 同じ細粒度の内容キャプションが入力
課題は3つ (§1)。(1) データ不足——この粒度のキャプション付き音声データはほぼ存在しない。(2) タスク互換性——話者情報の入口がテキストと参照音声とで異なる2タスクを、互いの学習を弱め合わずに同居させる必要がある。(3) マルチ音声モダリティ——1本の波形に音声・環境音・効果音・時には歌や音楽が混ざり、時間構造がまるで違う(音声は語彙との整合が命、環境音は安定、効果音は一瞬、歌は音程)。
なお、zero-shot側の生命線は「声が似ているか」です。声の類似は話者埋め込みベクトル同士の余弦類似度(向きの近さ)で測るのが定石で、この論文でも評価指標 (§4.2) と強化学習の報酬 (§3.5) の両方に登場します。まず下の図で感覚を掴んでおくと、後半がすっと読めます。
データ側の答え: SwanData-Caption (§2)
モデルの前に、まずデータです。SwanData-Captionは生の音声・オーディオを洗浄し、狙った領域を合成データで補い、多段階のキャプションを付ける4段構成のパイプラインで、約7,000万件のキャプションレコードを持ちます (§2)。
素材はショートドラマ・広告・アニメなどの実メディア音声。手薄になる領域は、発音精度を保つTTS教師モデルによる合成サブセット3種——高齢者音声、平均1.5秒の中英短文、多音字やブランド名などの発音難テキスト——で各10万発話ずつ補強します (§2.1)。人間は固有名詞の読み間違いに敏感なのに、モデルがその例をほとんど見ていない、という非対称への手当てです。
前処理はボーカル分離→話者ダイアライゼーション→ASR→アライメントという構成 (§2.2)。ASRの句読点は「意味で打たれていて実際のポーズと合わない」ため信用せず、後段のキャプション付与で意味に基づいて打ち直し、アライナのポーズ証拠で補正します。
キャプションは3欄形式です (§2.3)。Environment(シーンと持続的な背景音)、Speakers(実際に話した話者の安定した特徴。性別・年齢からペルソナ・声質・話し癖まで)、Content(<S1>タグ付きの時系列テキストに、局所的な感情変化や<Audio>タグの効果音を添える)。付与モデルが紋切り型の話者描写しか出さない問題には、アニメ/ドラマ/広告系の「スタイル・ペルソナ行列」を事前知識として与えます。原則は「聞こえない属性は書かない」——根拠のないラベルの混入を防ぐ設計です。
仕上げの精選 (§2.4) では、PESQ 2.0未満・STOI 0.85未満などの波形品質フィルタ、検証器SwanVerifier(付録§7)による性別・年齢ラベルの照合、人手監査を通します。表現力の監査は絶対評価のMOSではなく、4候補から最良と最悪を選ぶbest–worst比較で、採点基準のぶれを抑えます。
コメント
コメントにはログインが必要です