JA EN

#accelerator

3 記事

01 ·計算機アーキテクチャ·★ 会員·論文·12分で読めます シストリックアレイ — TPUの心臓部を1から In-Datacenter Performance Analysis of a Tensor Processing Unit 掛け算器を並べるだけでは速くならないのは、データを運ぶ手間が演算より重いからです。TPUの中心にある格子=シストリックアレイが、行列積の三重ループを縦・横・時間にどう割り当てているのかを、2×2の手計算からサイクル単位のコード、バッチと次元の実務まで前提知識ゼロで解きほぐします。 02 ·アクセラレータ·★ 会員·10分で読めます 推論チップ戦国時代 — Groq・Cerebras・LPUの設計思想 推論専用チップが乱立するのは、デコードが計算ではなく読み出しで律速されるからです。SRAM全載せ(Groq/LPU)とウェハスケール(Cerebras)という2つの答え、ソフト側の反撃、そしてベンチマーク数値を鵜呑みにせず市場を読むための式を、前提知識ゼロから解説します。 03 ·アクセラレータ·★ 会員·論文·10分で読めます AIアクセラレータの設計様式 — GPU/NPU/TPUは何が違うのか In-Datacenter Performance Analysis of a Tensor Processing Unit GPU・TPU・NPUは「汎用性をどこまで捨てて行列積に振るか」の答えが違う3つの流儀。シストリックアレイの仕組み、データフロー設計、量子化との共進化を、比喩→式→コードの順で前提知識ゼロから解説する。