JA EN

#pretraining

7 記事

01 ·LLM — 大規模言語モデル·★ 会員·論文·15分で読めます 論文解説: Puro-2B — コンシューマGPUで2Bモデルを$6.9Kからゼロ事前学習する Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090 ゲーミング向けGPUのRTX 5090で1.4兆トークンの事前学習を回し、Qwen2-1.5B級の性能に約$4.4Kで届いたという報告を、コスト構造・FP8・実効学習率・カリキュラム平均の順に1から解説する。 02 ·機械学習の基礎·★ 会員·論文·14分で読めます 自己教師あり学習 — ラベルなしデータが宝になった日 A Simple Framework for Contrastive Learning of Visual Representations 人がラベルを貼らなくても、データは自分で問題を作れる。マスク予測と対照学習という2つの流派を、比喩→InfoNCEの式→動く図→PyTorchコードの順に前提知識ゼロから解説し、LLMの事前学習がなぜ「最大の自己教師あり学習」なのかまでつなげます。 03 ·機械学習の基礎·★ 会員·論文·14分で読めます 自己教師あり学習 — ラベルなしデータが宝になった日 A Simple Framework for Contrastive Learning of Visual Representations 人がラベルを貼らなくても、データは自分で問題を作れる。マスク予測と対照学習という2つの流派を、比喩→InfoNCEの式→動く図→PyTorchコードの順に前提知識ゼロから解説し、LLMの事前学習がなぜ「最大の自己教師あり学習」なのかまでつなげます。 04 ·LLM — 大規模言語モデル·★ 会員·論文·11分で読めます 事前学習データの作り方 — Webから教科書品質へ The Pile: An 800GB Dataset of Diverse Text for Language Modeling 「大量のWebデータで学習した」の一行の裏には、本文抽出・品質フィルタ・重複除去・混合比という4つの工程がある。CommonCrawlという砂利の山から教科書品質の文章を選り分ける仕組みを、MinHashの式から現場で触るパラメータ名まで1から解説する。 05 ·LLM — 大規模言語モデル·★ 会員·論文·11分で読めます 事前学習データの作り方 — Webから教科書品質へ The Pile: An 800GB Dataset of Diverse Text for Language Modeling 「大量のWebデータで学習した」の一行の裏には、本文抽出・品質フィルタ・重複除去・混合比という4つの工程がある。CommonCrawlという砂利の山から教科書品質の文章を選り分ける仕組みを、MinHashの式から現場で触るパラメータ名まで1から解説する。 06 ·学習手法・アライメント·★ 会員·論文·12分で読めます データセット構築の実務 — 集める・洗う・混ぜる Self-Instruct: Aligning Language Models with Self-Generated Instructions モデルを作る仕事の大半は、実はデータセットを作る仕事です。母集団の設計、品質フィルタの閾値の決め方、テストへの漏れの検査、配合比が決めてしまう周回数、合成データの使いどころ、アノテーションのガイドライン設計までを、前提知識ゼロから1から解説します。 07 ·★ 会員·論文·13分で読めます 論文解説: マルチモーダル事前学習の『物理法則』— 知識はどのモダリティからどこへ流れるのか Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes テキストと画像を最初から1つのモデルで学ばせると何が起きるのか。Meta FAIRらの大規模な統制実験から、知識の非対称な流れ、シナジーが生まれる条件、『視覚の怠け』を防ぐ早期統一、そして生成データ5%で強い画像生成を成立させるレシピまでを読み解く。