PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#common-crawl
1 記事
01
2026-08-26
·
LLM — 大規模言語モデル
·
★ 会員
·
論文
·
11分で読めます
事前学習データの作り方 — Webから教科書品質へ
The Pile: An 800GB Dataset of Diverse Text for Language Modeling
「大量のWebデータで学習した」の一行の裏には、本文抽出・品質フィルタ・重複除去・混合比という4つの工程がある。CommonCrawlという砂利の山から教科書品質の文章を選り分ける仕組みを、MinHashの式から現場で触るパラメータ名まで1から解説する。