強化学習の基本概念
問題
強化学習に関する記述のうち誤りを1つ選べ。
解説
強化学習(Reinforcement Learning)は、AI(エージェント)が「環境」の中で自ら試行錯誤(行動)し、その結果として得られる「報酬」を最大化するように学習していく機械学習の一分野です。
正解データ(ラベル)は与えられず、自転車の乗り方を覚えるように「うまくできたら褒められる(報酬がもらえる)」という経験を通じて最適な行動ルール(方策)を見つけ出します。
自動運転、ロボット制御、ゲームAI(将棋や囲碁など)といった高度な自律制御システムの開発に欠かせない技術です。
1. 強化学習は環境との相互作用を通じて学習する
正しい:エージェントが環境の状態を観察し、行動を起こし、その結果として環境から報酬を受け取り、次の状態へ移行する…という相互作用のループで学習します。
2. 強化学習は報酬を最大化する方策を学ぶ
正しい:強化学習の最終目的は、長期的・累積的な報酬の合計を最大化するための最適な行動ルール(最適方策π)を学習することです。
3. 強化学習は必ず正解ラベルを使って学習する
誤り:強化学習は「正解ラベル」を与えられて学習するのではなく、行動の結果として得られる「報酬」を手がかりにして自立的に学習します。
4. 強化学習は試行錯誤を通じて行動を改善する
正しい:未知のより良い行動を探す「探索」と、これまでの経験から最良と思われる行動を選ぶ「活用」をバランス良く繰り返しながら改善を行います。
📚 より詳細を学びたい方へ
同じカテゴリの問題
- 教師あり学習の基本要件
- 回帰問題の理解
- 分類問題の特徴
- 決定木モデルの性質
- サポートベクターマシン(SVM)の理解
- カーネルとカーネルトリック
- 重回帰分析の理解
- 勾配ブースティングの特徴
- 多クラス分類の理解
- 教師あり学習のビジネス応用
- アンサンブル学習の基本概念
- バギングの特徴
- ブートストラップサンプリングの理解
- ランダムフォレストの性質
- ブースティングの理解
- ランダムフォレストの特徴
- 自己回帰モデル(AR)の理解
- VARモデルの特徴
- マージン最大化の理解
- ロジスティック回帰の理解
- 教師なし学習の基本概念
- k-means法の理解
- t-SNEの特徴
- ウォード法の理解
- 協調フィルタリングの理解
- クラスタリングの特徴
- 次元削減の理解
- 主成分分析(PCA)の理解
- 潜在的ディリクレ配分法(LDA)の理解
- 多次元尺度構成法(MDS)の理解
- デンドログラムの理解
- 特異値分解(SVD)の理解
- コンテンツベースフィルタリングの理解
- クラスタ分類の理解
- 強化学習の基本概念
- 方策(Policy)の理解
- 価値関数の理解
- 行動価値関数Q(s,a)の理解
- 状態価値関数V(s)の理解
- TD誤差の理解
- Actor-Criticの理解
- Q学習の特徴
- ε-greedy方策の理解
- UCB方策の理解
- バンディット問題の理解
- 方策勾配法の理解
- REINFORCEの特徴
- マルコフ決定過程(MDP)の理解
- マルコフ性の理解
- 期待割引報酬の理解
- 割引率γの理解
- 汎化性能の理解
- 訓練誤差と汎化誤差
- ホールドアウト検証の理解
- 交差検証の特徴
- k-分割交差検証の理解
- 混同行列の理解
- 偽陽性・偽陰性の理解
- 正解率の計算
- 適合率の計算
- 再現率の計算
- F値の理解
- 回帰指標MSEの理解
- RMSEの理解
- MAEの理解
- ROC曲線の理解
- AICの理解
- BICとオッカムの剃刀


