JA EN

#quantization

8 記事

01 ·Transformerの仕組み·★ 会員·論文·15分で読めます 論文解説: Gated DeltaNet はなぜ4bit量子化に耐えるのか — ハイブリッド27BのNVFP4 W4A4 Why Gated DeltaNet Survives 4-Bit Quantization: NVFP4 W4A4 for the Recurrent Half of a Hybrid 27B LLM ハイブリッドLLMの再帰層(Gated DeltaNet)は4bit量子化に弱い、という通説を実測で否定した論文の解説。ゲートの対数パラメータ化とdelta則の上書きが、なぜ量子化ノイズを消してしまうのかを1から追う。 02 ·蒸留と圧縮·★ 会員·論文·13分で読めます 蒸留・量子化・枝刈りの使い分け — 小さくする3つの道 Distilling the Knowledge in a Neural Network モデルを小さくする道は3本あります。数値の目盛りを粗くする量子化、重みそのものを間引く枝刈り、小さいモデルに作り直す蒸留。圧縮率・精度・実装コストの三軸で正面から比べ、「訓練を伴うものを先に、量子化を最後に」という組み合わせ順序の理由まで、前提知識ゼロから。 03 ·推論・高速化·★ 会員·13分で読めます 推論コスト削減の実務 — 何から手を付けるか 量子化も蒸留も効きますが、たいていの現場ではその前に「品質を1ミリも賭けずに済む手」が残っています。請求書を4つの数に分解し、キャッシュ→バッチング→短縮→圧縮の順に並べ替える。各手の効き方と、順序を間違えたときに何が壊れるかまで。 04 ·推論・高速化·★ 会員·10分で読めます LLM量子化を1から解説 — なぜ精度を落としても動くのか 16ビットの重みを4ビットに切り詰めても、モデルは文章を書き続けます。なぜ壊れないのか。スケールとゼロ点という2つの数から始め、重みは落とせるのに活性化が落としにくい理由(外れ値)、PTQとQATの分かれ道、INT8/INT4で実際に起きること、そして「perplexityだけ見て通す」という最も多い評価事故まで。 05 ·推論・高速化·★ 会員·10分で読めます LLM量子化を1から解説 — なぜ精度を落としても動くのか 16ビットの重みを4ビットに切り詰めても、モデルは文章を書き続けます。なぜ壊れないのか。スケールとゼロ点という2つの数から始め、重みは落とせるのに活性化が落としにくい理由(外れ値)、PTQとQATの分かれ道、INT8/INT4で実際に起きること、そして「perplexityだけ見て通す」という最も多い評価事故まで。 06 ·アクセラレータ·無料·11分で読めます 数の表し方 — FP32からFP8・INT4まで 符号・指数・仮数という3つの区画を1から見て、指数部が「範囲」を、仮数部が「精度」を決めることを押さえます。そこからbfloat16が生まれた理由、FP8にE4M3とE5M2の2種類がある理由、INT8/INT4の等間隔量子化で何が失われるのかへ。最後に、学習と推論でどの型を選び、精度劣化をどう検知するかまで。 07 ·アクセラレータ·無料·11分で読めます 数の表し方 — FP32からFP8・INT4まで 符号・指数・仮数という3つの区画を1から見て、指数部が「範囲」を、仮数部が「精度」を決めることを押さえます。そこからbfloat16が生まれた理由、FP8にE4M3とE5M2の2種類がある理由、INT8/INT4の等間隔量子化で何が失われるのかへ。最後に、学習と推論でどの型を選び、精度劣化をどう検知するかまで。 08 ·画像圧縮·★ 会員·12分で読めます JPEGはなぜ劣化するのか — DCTと量子化を1から 写真が10分の1になるとき、何が捨てられているのか。色空間変換・8×8ブロック・DCT・量子化テーブル・ジグザグ走査を順に追い、「品質90」という数字の正体と、ブロックノイズ/モスキートノイズが生まれる場所まで降りていきます。最後は、画像を扱う人が実際に決めることへ落とします。