JA EN

#sram

2 記事

01 ·アクセラレータ·★ 会員·10分で読めます 推論チップ戦国時代 — Groq・Cerebras・LPUの設計思想 推論専用チップが乱立するのは、デコードが計算ではなく読み出しで律速されるからです。SRAM全載せ(Groq/LPU)とウェハスケール(Cerebras)という2つの答え、ソフト側の反撃、そしてベンチマーク数値を鵜呑みにせず市場を読むための式を、前提知識ゼロから解説します。 02 ·計算機アーキテクチャ·★ 会員·論文·12分で読めます GPUのメモリ階層 — HBM・SRAM・レジスタと「移動が支配する」現実 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness GPUの速さを決めているのは演算器ではなく、レジスタ・共有メモリ・L2・HBMのどこにデータを置き、何回運ぶかです。階層の容量と帯域の桁、演算強度とタイル化、階層ごとに引くルーフライン、そして「FLOPsを増やしたのに速くなる」FlashAttentionまでを前提知識ゼロから追います。