報酬成形(Reward Shaping)の理解
問題
報酬成形について、誤っている記述を1つ選べ。
解説
報酬成形(Reward Shaping)とは、強化学習においてエージェント(AI)が効率よく学習できるように、人間が「本来の最終目的(例:ゴールする=+100)」だけでなく、「そこに至るまでの過程(例:一歩前に進む=+1)」にも人工的な補助報酬(中間報酬)を設計して与える手法です。
報酬が得られる頻度(疎な報酬)の問題を解決し学習を加速させますが、設計を間違えると「ゴールせずにその場でぐるぐる回って中間報酬だけを稼ぎ続ける」といった意図しない不正な行動(報酬ハッキング)を引き起こすリスクがあります。
1. 報酬成形は学習を促進するため人工的な報酬を追加する。
正しい:最終目標だけでなく、望ましい行動の過程に対しても人間が人工的に報酬(ペナルティ含む)を設計して追加し、学習を導く手法です。
2. 報酬成形は中間目標に小報酬を与えるなどの設計が可能。
正しい:「迷路をクリアする(+100)」だけでなく、「ゴールに近づくたびに小さな報酬(+1)を与える」といった中間目標を設定することで、学習の迷いを減らします。
3. 報酬成形は設計次第で学習が安定したり不安定になったりする。
正しい:上手く設計すれば学習が劇的に速くなりますが、設計が不適切だと「本来の目的とは違うズルい方法で報酬を稼ぐ(報酬ハッキング)」ようになり、学習が失敗します。
4. 報酬成形は本来の報酬を完全に無視して学習する手法である。
誤り:本来の報酬(最終目標)を無視するわけではなく、本来の報酬に到達しやすくするために「補助的な報酬」を追加してガイドする手法です。
📚 より詳細を学びたい方へ
同じカテゴリの問題
- tanh関数の理解
- 勾配消失問題と活性化関数の関係
- エポック(Epoch)とイテレーションの理解
- 鞍点(Saddle Point)の理解
- ストライド(stride)の理解
- BPTTの理解
- 位置エンコーディングの理解
- MixupおよびCutMixの理解
- 物体識別と物体検出の違い
- セマンティックセグメンテーションの特徴
- インスタンスセグメンテーションの理解
- パノプティックセグメンテーションの特徴
- 姿勢推定(Pose Estimation)の理解
- AlexNetの特徴
- GoogLeNet(Inception)の理解
- VGGの構造的特徴
- ResNetの残差学習の理解
- Wide ResNetの特徴
- DenseNetの密結合構造
- EfficientNetとMobileNetの理解
- NAS(ニューラルアーキテクチャ探索)の特徴
- MnasNetの探索戦略
- NASNetのセル構造
- SENet(Squeeze-and-Excitation Network)の理解
- Vision Transformer(ViT)の特徴
- Fast R-CNNの処理構造
- Faster R-CNNのRPN
- Mask R-CNNの追加機能
- SSD(Single Shot MultiBox Detector)の特徴
- YOLO(You Only Look Once)の特徴
- FPN(Feature Pyramid Network)の理解
- FCN(Fully Convolutional Network)の特徴
- OpenPoseとPart Affinity Fields
- BERTの事前学習タスク
- Bag-of-Words(BoW)の特徴
- word2vecの理解
- fastTextのサブワード学習
- CBOW(Continuous Bag-of-Words)の特徴
- skip-gramの特徴
- CEC(Constant Error Carousel)の役割
- ELMoの文脈化表現
- GPTモデルの学習方式
- PaLMの理解
- Seq2Seqモデルの構造
- TF-IDFの重要度計算
- 形態素解析の役割
- 構文解析の目的
- 感情分析の特徴
- 文書要約の種類
- A-D変換(アナログ-デジタル変換)のプロセス
- WaveNetの特徴
- 音韻の理解
- 音声認識の基本
- 音素の理解
- 隠れマルコフモデル(HMM)の特徴
- 高速フーリエ変換(FFT)の理解
- スペクトル包絡の特徴
- PCM(パルス符号変調)の理解
- MFCC(メル周波数ケプストラム係数)の特徴
- CTC(Connectionist Temporal Classification)の理解
- A3C(Asynchronous Advantage Actor-Critic)の特徴
- Agent57の特徴
- APE-Xの理解
- DQN(Deep Q-Network)の理解
- Double DQNの理解
- Dueling Networkの特徴
- PPO(Proximal Policy Optimization)の理解
- OpenAI Fiveの特徴
- AlphaStarの理解
- sim2realの課題
- ドメインランダマイゼーションの理解
- ノイジーネットワークの特徴
- 報酬成形(Reward Shaping)の理解
- GAN(敵対的生成ネットワーク)の理解
- DCGANの特徴
- Diffusion Modelの理解
- NeRF(Neural Radiance Fields)の特徴
- Pix2Pixの理解
- CycleGANの特徴
- StyleGANの理解
- データ生成タスクの応用
- 転移学習の基本概念
- ファインチューニングの特徴
- Few-shot / One-shot 学習の理解
- 自己教師あり学習の役割
- 破壊的忘却(Catastrophic Forgetting)
- 半教師あり学習の特徴
- マルチモーダルAIの基本理解
- CLIPの特徴理解
- DALL-Eの役割
- Visual Question Answeringの理解
- zero-shot推論の理解
- マルチタスク学習の特徴
- CAMの特徴に関する問題
- Grad-CAMの理解
- LIMEの特徴
- SHAPの特徴理解
- 知識蒸留の理解
- プルーニングの理解
- 量子化の理解
- 説明可能AI(XAI)の理解


