戦国IT - 情報処理技術者試験の過去問対策サイト
ブログお知らせお問い合わせ料金プラン

ITパスポート 2025年 08


問題文

AIの機械学習で利用するデータの取扱いに関する記述のうち、バイアスの低減やデータの品質を確保するために考えられる対策として、適切なものだけを全て挙げたものはどれか。
a 学習の目的に適したデータであることを確認する。 b データの入手元・作成来歴を確認する。 c データへのアノテーションの付与は学習目的に合わせて実施する。 d 人間の目でも同定が困難と考えられる画像認識用のデータは除外する。

選択肢

a, b
a, b, c, d(正解)
a, d
b, c, d

🔒 解説は解答すると表示されます

AIの機械学習で利用するデータの取扱いに関する記述【ITパスポート 解説】

正解の理由

この問題の適切な対策は、すべて(a, b, c, d)を含む選択肢です。したがって正解は (a, b, c, d)です。
各項目は機械学習でバイアス(偏り)を減らし、データの品質を保つために有効な基本対策だからです。
  • a: 学習の目的に合ったデータを使うことは、モデルが学ぶべき情報を正しく学習できるようにする根本です。目的外のデータが混じると誤学習や偏りを生みます。
  • b: データの入手元・作成来歴(プロベナンス:provenance=由来)を確認すると、収集方法や偏りの原因、不適切なデータの混入を見つけられます。説明責任や倫理面でも重要です。
  • c: アノテーション(annotation:データに正解ラベルや注釈を付ける作業)を学習目的に合わせて行うことで、ラベルの一貫性や適切性が担保され、誤った教師情報を与えずに済みます。
  • d: 人間の目でも同定が困難な画像は、ラベルノイズ(誤ったラベル)や学習の不確実性を増やします。こうしたデータを除外することは品質向上とバイアス低減に寄与します。
以上より、すべての選択肢が妥当な対策であるため が正解です。

解法ステップ

  1. 各選択肢(a〜d)を一つずつ「バイアス低減」や「データ品質確保」の観点で評価します。
  2. 「適切な対策」として当てはまるかを判断します。
    • 目的適合性(a)は全てのプロジェクトで必須。
    • 来歴の確認(b)は偏りや倫理問題の発見に直結。
    • アノテーションの統制(c)は教師あり学習で特に重要。
    • 判別不能データの除外(d)はラベルの信頼性向上と学習効率化に有効。
  3. すべて妥当なので、すべて含む選択肢()を選びます。

選択肢別の誤答解説

  • ア(a, b)
    a と b は正しいですが、c(アノテーションの適切化)や d(判別困難な画像の除外)も重要です。従ってアは不完全です。
  • ウ(a, d)
    a, d は有効ですが、データの入手元やアノテーション管理を無視してよいわけではありません。b と c が欠けています。
  • エ(b, c, d)
    b, c, d は適切ですが、「学習の目的に適したデータであることを確認する」こと(a)を抜かすと、そもそも学習対象がずれているリスクが残ります。よって不完全です。

よくある誤解

  1. 「データは量があればよい」
    • 大量でも目的に合わない、偏った、またはラベルが間違っているデータだと性能は上がりません。質(ラベルの正確さ・多様性・由来確認)が重要です。
  2. 「人間が識別できないデータでもモデルなら識別できる」
    • 一部の高度なケースを除き、モデルは人間のラベルを教師に学ぶため、人間も識別困難なデータはノイズになりやすいです。
  3. 「入手元の確認は法律対応だけの作業」
    • 法的側面以外に、収集手法による偏りや特定集団の過剰/不足など、性能と公平性に直結する問題を見つけられます。

補足コラム

  • データプロベナンス(provenance)とは?
    データがどこで、誰によって、どのように集められたかの記録です。データセットの説明(例:収集期間、収集方法、対象の属性分布、アノテータの基準など)を残すことが推奨されます。近年は「Datasheets for Datasets(データセットの仕様書)」のような形式が注目されています。
  • アノテーションの品質管理方法
    • ガイドラインを作る:担当者間で基準をそろえる
    • 複数人でラベル付けし一致率を測る:一致率が低ければ基準を見直す
    • サンプル検査や定期的なレビューを行う
  • 判別困難なデータの扱い方
    • 除外するのが一般的だが、除外基準は明確にする(例:人間の識別率が70%未満なら除外)。また、難しいケースを別クラスとして扱い、モデルの不確実性を評価する方法もあります。

FAQ

Q1: アノテーションは外注してもよいですか?
A1: よいです。ただし外注先にもガイドラインを渡し、サンプルチェックや一致率の確認を必ず行ってください。品質管理が鍵です。
Q2: どの程度のデータが「学習の目的に適している」か分かりません。
A2: 目的を具体化(何を判定したいか、どの誤分類が許容できないか)し、目標に直結する属性やラベルが十分にカバーされているかを確認します。初期は少量の検証データで試すと効果的です。
Q3: 画像が多少ぼやけている場合は全部除外すべきでしょうか?
A3: ぼやけ具合や用途によります。若干のノイズはモデルの頑健性を高めますが、過度に識別不能な画像はノイズになります。閾値を決めて一貫して処理するのが良いです。

関連キーワード: 機械学習、データ品質、バイアス低減、アノテーション、データプロベナンス、ラベル品質、データガバナンス、モデル公平性
← 前の問題へこの年度をクイズで解く次の問題へ →
戦国ITクイズ機能

\ せっかくなら /

ITパスポート
クイズ形式で学習しませんか?

クイズ画面へ遷移する

すぐに利用可能!

©︎2026 情報処理技術者試験対策アプリ

このサイトについてブログプライバシーポリシー利用規約特商法表記開発者について