JA EN

#speech-recognition

2 記事

01 ·音声系·無料·14分で読めます 音声認識を1から — 波形からテキストまで マイクが拾う数字の列がどうやって文字になるのかを前提知識ゼロから。スペクトログラムによる特徴抽出、アラインメント問題を解いたCTC、自己回帰デコーダのencoder-decoder、そしてWhisperまでを歴史の順に追う。 02 ·音声系·★ 会員·論文·9分で読めます 論文解説: Whisperはなぜ頑健なのか — 大規模弱教師あり学習 Robust Speech Recognition via Large-Scale Weak Supervision Whisper原論文(Radford et al., 2022)を本文だけを根拠に読む。波形からログメルスペクトログラムへ、そしてencoder-decoderで直接テキストを出す設計。68万時間という規模が「ファインチューニングなしで頑健」をどう生んだのか、論文が実際に測った数字と、論文自身が認めた限界まで。