JA EN

#audio-generation

2 記事

01 ·生成モデル·★ 会員·論文·11分で読めます 音楽・音声生成を1から — トークン化された音 Simple and Controllable Music Generation 3分の曲は1500万個以上の数値でできています。音楽生成の技術史は、この途方もない数列をどう畳むかの歴史でした。コーデックトークン、自己回帰と拡散の分かれ道、テキスト条件づけ、そしてSuno系サービスの構造を公開された部品から組み立て直すところまで、前提知識ゼロで解説します。 02 ·音声系·★ 会員·論文·13分で読めます 論文解説: SwanTale — 参照音声なしで「言葉から声をデザインする」統合音声・オーディオ生成 SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks ByteDanceのSwanTaleは、参照音声から声を写すzero-shot TTSと、自然言語キャプションだけで声・環境音・効果音まで一体生成するinstructタスクを1つのモデルで実現した。7000万件のキャプションデータ基盤SwanData-CaptionからUnified MoE、GRPO後訓練まで、論文本文に沿って読み解く。