データリーケージ(Data Leakage)の理解
問題
データリーケージ(本来知り得ない情報の混入)に関する記述として、正しいものを1つ選べ。
解説
「データリーケージ(情報漏洩)」とは、AIモデルの学習データの中に、本来なら「未来において予測する時点で初めて分かるはずの情報(目的変数と直接つながる情報)」が誤って混入してしまう現象です。
これが発生すると、AIがその情報を「カンニング」して学習するため、手元のテストデータでは100%近い異常に高い精度が出ますが、いざ本番環境で運用すると全く予測が当たらないという致命的な失敗につながります。
1. データリーケージはモデルの性能を安定させるために意図的に利用される技術である。
誤り:データリーケージは、モデルの評価を著しく歪め、実運用での失敗を招く「重大なバグ・設計ミス」であり、意図的に利用されるような技術ではありません。
2. データリーケージが発生すると、学習時の性能が不自然に高くなることがある。
正しい:予測時に本来使えない未来の情報(例:明日の売上データが今日の学習用特徴量に混ざっている等)を学習してしまうため、学習時やテスト時の精度が不自然なほど高くなります。
3. データリーケージはテストデータを増やすことで必ず防止できる。
誤り:リーケージは「データ分割の不備」や「特徴量エンジニアリング時のミス」によって生じるため、単にテストデータの「量」を増やしても防止・解決することはできません。
4. データリーケージは実運用では影響が小さいため、深刻な問題ではない。
誤り:実運用では、カンニングの材料(リーケージした特徴量)が存在しないため、予測精度が大幅に低下し、ビジネス上の重大な損失を招く極めて深刻な問題です。
📚 より詳細を学びたい方へ


