JA EN

#annotation

1 記事

01 ·学習手法・アライメント·★ 会員·論文·12分で読めます データセット構築の実務 — 集める・洗う・混ぜる Self-Instruct: Aligning Language Models with Self-Generated Instructions モデルを作る仕事の大半は、実はデータセットを作る仕事です。母集団の設計、品質フィルタの閾値の決め方、テストへの漏れの検査、配合比が決めてしまう周回数、合成データの使いどころ、アノテーションのガイドライン設計までを、前提知識ゼロから1から解説します。