JA EN

#cost

7 記事

01 ·エージェント·★ 会員·論文·16分で読めます 論文解説: EarlyEval — エージェント評価を「途中で打ち切って」安くする EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction エージェントの評価は1回数百ドルかかる。EarlyEvalは「結末は途中の振る舞いから読める」という発見を使い、実行を途中で止めて費用を13〜26%削る。仕組み・実験値・限界を論文本文から解説。 02 ·LLM — 大規模言語モデル·★ 会員·論文·15分で読めます 論文解説: Puro-2B — コンシューマGPUで2Bモデルを$6.9Kからゼロ事前学習する Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 ゲーミング向けGPUのRTX 5090で1.4兆トークンの事前学習を回し、Qwen2-1.5B級の性能に約$4.4Kで届いたという報告を、コスト構造・FP8・実効学習率・カリキュラム平均の順に1から解説する。 03 ·推論・高速化·★ 会員·14分で読めます プロンプトキャッシュとコンテキスト設計 — 前方一致という一本の制約が、請求額を桁で変える 同じシステムプロンプトを毎回読み直させて、毎回その分を払っていませんか。プロンプトキャッシュは前方一致でしか効かない——この一点だけで、コンテキストに何をどの順で置くべきかが決まります。先頭に現在時刻を1つ入れただけで全滅する理由と、TTLを読み違えて逆に25%高くなる事故まで。 04 ·推論・高速化·★ 会員·13分で読めます 推論コスト削減の実務 — 何から手を付けるか 量子化も蒸留も効きますが、たいていの現場ではその前に「品質を1ミリも賭けずに済む手」が残っています。請求書を4つの数に分解し、キャッシュ→バッチング→短縮→圧縮の順に並べ替える。各手の効き方と、順序を間違えたときに何が壊れるかまで。 05 ·クラウドと運用·無料·13分で読めます サーバーレスとコスト設計 — 破産しないクラウド 「使った分だけ払う」は「使われた分だけ請求される」でもあります。スケールゼロの仕組み、GB-秒という課金単位、請求が指数で伸びる事故のパターンを前提知識ゼロから積み上げ、最後は自分のプロジェクトにキルスイッチを設計できるところまで持っていきます。 06 ·クラウドと運用·★ 会員·13分で読めます GPUクラウドの経済学 — 借りるか・買うか・予約するか 同じGPUには4つの値段が同時についている。オンデマンド・予約・スポット・自前を1本の式で比べ、損益分岐の稼働率、中断込みのスポット実効単価、コミットの消化率、そして請求書に隠れる項目までを掛け算と割り算だけで追う。 07 ·スケーリングと電力·★ 会員·12分で読めます チップレットの経済学 — 大きく作れないから分ける チップを分けるのは速くなるからではなく、分けないと売れる値段で作れないから。レチクル限界と歩留まりの指数、良品1個あたりの原価、分割が損に転じる折り返し点、プロセスの混載、そしてUCIeという「縫い目の規格」までを算数で追う。