JA EN

#common-crawl

1 記事

01 ·LLM — 大規模言語モデル·★ 会員·論文·11分で読めます 事前学習データの作り方 — Webから教科書品質へ The Pile: An 800GB Dataset of Diverse Text for Language Modeling 「大量のWebデータで学習した」の一行の裏には、本文抽出・品質フィルタ・重複除去・混合比という4つの工程がある。CommonCrawlという砂利の山から教科書品質の文章を選り分ける仕組みを、MinHashの式から現場で触るパラメータ名まで1から解説する。