JA EN

#weak-supervision

1 記事

01 ·音声系·★ 会員·論文·9分で読めます 論文解説: Whisperはなぜ頑健なのか — 大規模弱教師あり学習 Robust Speech Recognition via Large-Scale Weak Supervision Whisper原論文(Radford et al., 2022)を本文だけを根拠に読む。波形からログメルスペクトログラムへ、そしてencoder-decoderで直接テキストを出す設計。68万時間という規模が「ファインチューニングなしで頑健」をどう生んだのか、論文が実際に測った数字と、論文自身が認めた限界まで。