Multi-Head Attentionの理解
問題
Multi-Head Attention(多頭注意機構)について、以下の記述のうち誤りを1つ選べ。
解説
Multi-Head Attention(多頭注意機構)は、TransformerにおいてSelf-Attentionの表現力を劇的に高めるための仕組みです。
1つのAttentionで文脈を捉えようとすると、「誰が(主語)」「何を(目的語)」といった様々な関係性が混ざってしまいます。
そこで、入力データを複数(例:8個や12個など)の小さな次元(Head)に分割し、それぞれ独立して「異なる観点(文法構造や意味の繋がりなど)」からAttentionを並列計算させ、最後に結合します。
1. Multi-Head Attentionは複数のSelf-Attentionを並列に行う。
正しい:1つの大きなAttentionを計算するのではなく、複数の小さなAttention(Head)を並列に計算させて最後に統合します。
2. 各Headは異なる特徴(文法・意味など)に注目できる。
正しい:各Headがランダムな初期値から学習を始めることで、「あるHeadは主語と述語の関係」「別のHeadは代名詞の指す先」といった具合に、自然と異なる特徴に注目するようになります。
3. Multi-Head AttentionはSelf-Attentionより表現力が低い。
誤り:複数の視点(Head)から同時に情報を抽出して統合するため、単一のSelf-Attentionよりも圧倒的に「高い表現力」を持ちます。
4. Multi-Head AttentionはTransformerの中心的な構成要素である。
正しい:TransformerのEncoderブロックにもDecoderブロックにも組み込まれており、モデルの性能を決定づける中心的な要素です。
📚 より詳細を学びたい方へ
同じカテゴリの問題
- TPUの理解
- ノーフリーランチの定理の理解
- 全結合層の特徴に関する問題
- 全結合層のパラメータ数に関する問題
- 畳み込み層の役割に関する問題
- カーネル(フィルタ)の理解
- パディングの目的
- 特徴マップの理解
- CNNの構造に関する問題
- Depthwise Separable Convolution
- Dilation Convolution の理解
- 全結合層と畳み込み層の違い
- バッチ正規化(Batch Normalization)の理解
- 正規化層の役割に関する問題
- プーリング層の役割に関する問題
- 最大値プーリングと平均値プーリングの理解
- グローバルアベレージプーリング(GAP)の特徴
- スキップ結合の役割に関する問題
- Residual Network(ResNet)の特徴
- 回帰結合層の理解
- RNNの特徴に関する問題
- LSTMのゲート構造
- GRUの特徴に関する問題
- 双方向RNNの理解
- Attentionの役割に関する問題
- Self-Attentionの特徴
- Multi-Head Attentionの理解
- Transformerの構造に関する問題
- Encoder-Decoder Attentionの理解
- Seq2SeqとAttentionの関係
- オートエンコーダの基本理解
- 積層オートエンコーダの特徴
- 次元削減とオートエンコーダ
- 変分オートエンコーダ(VAE)の理解
- データ拡張の基本理解
- 画像データ拡張手法の理解
- テキストデータの拡張手法


