JA EN

#data-leakage

3 記事

01 ·評価と審判·★ 会員·論文·12分で読めます ベンチマーク汚染 — 「高スコア」を疑う技術 Rethinking Benchmark and Contamination for Language Models with Rephrased Samples ベンチマークの高スコアが実力なのか暗記なのかを見分けるための記事。汚染の3つの型、n-gram重なり・埋め込み近傍・メンバーシップ推論という検出手段とその限界、カナリア文字列と時系列分割の仕組みを1から解説し、論文を読むときの警戒点をチェックリストにまとめる。 02 ·機械学習の基礎·★ 会員·14分で読めます データリークと実験管理 — 精度が高すぎたら疑うこと モデルの数字が思ったより良いとき、喜ぶ前に疑うべきものがあります。予測時点では手に入らない情報が学習や選択に混ざる「リーク」を、結果由来の列・前処理・時間・重複・テストの擦り切れの5種類に分けて解説し、ラベルシャッフルなどの検知手順と、原因を後から特定できる実験記録の作り方までを前提知識ゼロから積み上げます。 03 ·機械学習の基礎·★ 会員·9分で読めます 過学習と評価設計 — 精度99%を疑え 訓練データに合わせすぎたモデルはなぜ現場で壊れるのか。train/validation/testの役割分担、交差検証、実務で最も多い失敗であるデータリーク、不均衡データで精度が嘘をつく仕組みと、適合率・再現率・F1の使い分けまで。