JA EN

#dataset

4 記事

01 ·★ 会員·論文·20分で読めます 論文解説: SolarWM — 5秒で学習して1時間歩き回れる動画ワールドモデルを、データごと全部開ける SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models 10個のデータセットを143万クリップの統一契約に揃える「データエンジン」と、4種類の動画生成バックボーンをそのまま活かす3段階の学習レシピ。5秒の系列だけで学習した因果モデルが、分〜時間スケールのロールアウトを続ける。 02 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説: CyberFactory — 野生のCVEを「実行できる訓練問題」に変える CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild 実世界のCVEを実行・検証できるタスクへ変換し、再利用可能な「脆弱性解析スキル」で教師の軌跡を合成してモデルに内面化させるオープンソース基盤。CyberGymで Pass@1 58.1%。 03 ·LLM — 大規模言語モデル·★ 会員·論文·11分で読めます 事前学習データの作り方 — Webから教科書品質へ The Pile: An 800GB Dataset of Diverse Text for Language Modeling 「大量のWebデータで学習した」の一行の裏には、本文抽出・品質フィルタ・重複除去・混合比という4つの工程がある。CommonCrawlという砂利の山から教科書品質の文章を選り分ける仕組みを、MinHashの式から現場で触るパラメータ名まで1から解説する。 04 ·学習手法・アライメント·★ 会員·論文·12分で読めます データセット構築の実務 — 集める・洗う・混ぜる Self-Instruct: Aligning Language Models with Self-Generated Instructions モデルを作る仕事の大半は、実はデータセットを作る仕事です。母集団の設計、品質フィルタの閾値の決め方、テストへの漏れの検査、配合比が決めてしまう周回数、合成データの使いどころ、アノテーションのガイドライン設計までを、前提知識ゼロから1から解説します。