JA EN
体系 › 半導体

アクセラレータ

数の表し方と量子化・GPU/NPU/TPUの設計様式・エッジ実装

01 ·アクセラレータ·★ 会員·論文·10分で読めます AIアクセラレータの設計様式 — GPU/NPU/TPUは何が違うのか In-Datacenter Performance Analysis of a Tensor Processing Unit GPU・TPU・NPUは「汎用性をどこまで捨てて行列積に振るか」の答えが違う3つの流儀。シストリックアレイの仕組み、データフロー設計、量子化との共進化を、比喩→式→コードの順で前提知識ゼロから解説する。 02 ·アクセラレータ·無料·11分で読めます 数の表し方 — FP32からFP8・INT4まで 符号・指数・仮数という3つの区画を1から見て、指数部が「範囲」を、仮数部が「精度」を決めることを押さえます。そこからbfloat16が生まれた理由、FP8にE4M3とE5M2の2種類がある理由、INT8/INT4の等間隔量子化で何が失われるのかへ。最後に、学習と推論でどの型を選び、精度劣化をどう検知するかまで。 03 ·アクセラレータ·★ 会員·10分で読めます 推論チップ戦国時代 — Groq・Cerebras・LPUの設計思想 推論専用チップが乱立するのは、デコードが計算ではなく読み出しで律速されるからです。SRAM全載せ(Groq/LPU)とウェハスケール(Cerebras)という2つの答え、ソフト側の反撃、そしてベンチマーク数値を鵜呑みにせず市場を読むための式を、前提知識ゼロから解説します。