バンディット問題の理解
問題
以下の文章を読み、空欄 ( あ ) ~ ( う ) に最もよく当てはまる語句の組み合わせとして適切なものを1つ選べ。
バンディットアルゴリズムは強化学習の特殊なケースであり、通常の強化学習と異なり ( あ ) を考慮しないという特徴がある。
実務において、従来のA/Bテストと比較して探索中の ( い ) を最小限に抑えつつ、動的に ( う ) と探索のバランスを取りながら最適な選択肢を絞り込む手法として用いられる。
解説
バンディットアルゴリズム(多腕バンディット問題)は、強化学習の特殊なケースであり、環境からの「状態の遷移(変化)」を考慮せずに、複数の選択肢(腕)から最も報酬が得られるものを探索するアルゴリズムです。
通常のA/Bテストでは探索期間中に劣る選択肢も均等に試すため「機会損失」が生じますが、バンディットアルゴリズムは探索と「活用(これまでで最も良かった選択肢を選ぶこと)」のバランスを取り、機会損失(後悔)を最小限に抑えながら最適な選択肢を動的に絞り込みます。
1. (あ) 状態の遷移 (い) 機会損失 (う) 活用
正しい。「状態の遷移」がないのがバンディットアルゴリズムの特徴であり、探索と「活用」のトレードオフを最適化し、「機会損失」を最小化します。
2. (あ) 状態の遷移 (い) 計算コスト (う) 割引報酬
誤り。(い)は機会損失、(う)は活用が適切です。
3. (あ) 報酬の遅延 (い) 機会損失 (う) 割引報酬
誤り。(あ)は状態の遷移、(う)は活用が適切です。
4. (あ) 報酬の遅延 (い) 計算コスト (う) 活用
誤り。(あ)は状態の遷移、(い)は機会損失が適切です。
📚 より詳細を学びたい方へ
同じカテゴリの問題
- 教師あり学習の基本要件
- 回帰問題の理解
- 分類問題の特徴
- 決定木モデルの性質
- サポートベクターマシン(SVM)の理解
- カーネルとカーネルトリック
- 重回帰分析の理解
- 勾配ブースティングの特徴
- 多クラス分類の理解
- 教師あり学習のビジネス応用
- アンサンブル学習の基本概念
- バギングの特徴
- ブートストラップサンプリングの理解
- ランダムフォレストの性質
- ブースティングの理解
- ランダムフォレストの特徴
- 自己回帰モデル(AR)の理解
- VARモデルの特徴
- マージン最大化の理解
- ロジスティック回帰の理解
- 教師なし学習の基本概念
- k-means法の理解
- t-SNEの特徴
- ウォード法の理解
- 協調フィルタリングの理解
- クラスタリングの特徴
- 次元削減の理解
- 主成分分析(PCA)の理解
- 潜在的ディリクレ配分法(LDA)の理解
- 多次元尺度構成法(MDS)の理解
- デンドログラムの理解
- 特異値分解(SVD)の理解
- コンテンツベースフィルタリングの理解
- クラスタ分類の理解
- 強化学習の基本概念
- 方策(Policy)の理解
- 価値関数の理解
- 行動価値関数Q(s,a)の理解
- 状態価値関数V(s)の理解
- TD誤差の理解
- Actor-Criticの理解
- Q学習の特徴
- ε-greedy方策の理解
- UCB方策の理解
- バンディット問題の理解
- 方策勾配法の理解
- REINFORCEの特徴
- マルコフ決定過程(MDP)の理解
- マルコフ性の理解
- 期待割引報酬の理解
- 割引率γの理解
- 汎化性能の理解
- 訓練誤差と汎化誤差
- ホールドアウト検証の理解
- 交差検証の特徴
- k-分割交差検証の理解
- 混同行列の理解
- 偽陽性・偽陰性の理解
- 正解率の計算
- 適合率の計算
- 再現率の計算
- F値の理解
- 回帰指標MSEの理解
- RMSEの理解
- MAEの理解
- ROC曲線の理解
- AICの理解
- BICとオッカムの剃刀


