JA EN

#rtx-5090

1 記事

01 ·LLM — 大規模言語モデル·★ 会員·論文·15分で読めます 論文解説: Puro-2B — コンシューマGPUで2Bモデルを$6.9Kからゼロ事前学習する Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 ゲーミング向けGPUのRTX 5090で1.4兆トークンの事前学習を回し、Qwen2-1.5B級の性能に約$4.4Kで届いたという報告を、コスト構造・FP8・実効学習率・カリキュラム平均の順に1から解説する。