JA EN

#audio-tokens

2 記事

01 ·音声系·★ 会員·論文·17分で読めます 音の表現 — メルスペクトログラムとトークン化 Robust Speech Recognition via Large-Scale Weak Supervision 音声モデルが波形をそのまま食べない理由から出発し、短時間フーリエ変換 → メル目盛り → 対数 → 離散トークンという変換の連鎖を前提知識ゼロで解説。窓長のトレードオフ、MFCCがDCTを捨てた事情、音響トークンと意味トークンの違い、そして設定を1つ間違えるだけで音が壊れる現場の落とし穴まで。 02 ·音声圧縮·★ 会員·論文·17分で読めます ニューラル音声コーデック — EnCodecとLLM音声の土台 High Fidelity Neural Audio Compression MP3やOpusが人手で「捨て方」を設計したのに対し、ニューラル音声コーデックは符号化そのものを学習し、音を有限個の整数トークンに変えます。ベクトル量子化から残差量子化(RVQ)、EnCodecのビットレート計算、そしてVALL-EやAudioLMのような音声LLMがなぜこの上に建つのかまでを、前提知識ゼロから解説します。