JA EN

#mdl

1 記事

01 ·情報理論·★ 会員·論文·14分で読めます 圧縮=予測=知能 — 情報理論から見るLLM Language Modeling Is Compression 次のトークンを当てる訓練は、そのままファイルを縮める訓練でもあります。算術符号化を経由すると「確率モデル」と「符号」が同じものだと分かり、交差エントロピー損失が圧縮後のバイト数そのものになる。Hutter Prizeが圧縮率を知能の指標に据えた理由まで、1から積み上げます。