PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#audio-generation
2 記事
01
2026-08-27
·
生成モデル
·
★ 会員
·
論文
·
11分で読めます
音楽・音声生成を1から — トークン化された音
Simple and Controllable Music Generation
3分の曲は1500万個以上の数値でできています。音楽生成の技術史は、この途方もない数列をどう畳むかの歴史でした。コーデックトークン、自己回帰と拡散の分かれ道、テキスト条件づけ、そしてSuno系サービスの構造を公開された部品から組み立て直すところまで、前提知識ゼロで解説します。
02
2026-08-13
·
音声系
·
★ 会員
·
論文
·
13分で読めます
論文解説: SwanTale — 参照音声なしで「言葉から声をデザインする」統合音声・オーディオ生成
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
ByteDanceのSwanTaleは、参照音声から声を写すzero-shot TTSと、自然言語キャプションだけで声・環境音・効果音まで一体生成するinstructタスクを1つのモデルで実現した。7000万件のキャプションデータ基盤SwanData-CaptionからUnified MoE、GRPO後訓練まで、論文本文に沿って読み解く。