AI実装検定S級~模擬試験~ 2024年11月3日 ailearn 1. Word2VecのSkip-gramモデルで「文脈が不明な単語」を効果的に処理するために使用される技術は何ですか? 文脈を複数のサンプルに分割して、異なる文脈で単語を学習させる 単語のシャッフリング 単語ベクトルの次元数を増やす 文法的ルールを適用する None 2. HREDモデルの訓練時に「長短期記憶(LSTM)」と「ゲート付きリカレントユニット(GRU)」のどちらを使用するか選択する際のポイントは何ですか? モデルのパラメータ数がLSTMよりもGRUの方が少なく、計算が高速になるため LSTMの方がGRUよりも常に優れているため GRUは勾配消失問題を完全に解決できるため GRUは学習速度が遅いため None 3. HREDモデルの基本的な構造は次のうちどれですか? 単一のRNNエンコーダとデコーダ 階層的に複数のエンコーダとデコーダを持つモデル 畳み込みニューラルネットワーク(CNN)を使用したモデル 自己注意機構を使用したTransformerモデル None 4. GPT(Generative Pre-trained Transformer)モデルがBERTとは異なる点は何ですか? GPTは双方向の文脈を同時に学習するが、BERTは単方向の文脈しか学習しない GPTは単方向の文脈を学習し、テキスト生成タスクに特化している GPTはエンコーダのみを使用し、BERTはデコーダのみを使用する GPTは翻訳タスク専用で、BERTは分類タスク専用である None 5. EfficientNetが「軽量」でありながら「高精度」を実現できる理由は何ですか? MBConvブロック、リニアボトルネック、SEブロックの効率的な組み合わせによるため 全結合層を使用していないため 活性化関数をReLUからSigmoidに変更したため モデルの深さを無限に増やせるため None 6. EfficientNetにおいて「MBConvブロック」の主な役割は何ですか? 低次元空間での情報を学習し、計算コストを削減するため チャネルの次元を削減し、重要な特徴を強調するため 残差接続を無効にするため 特徴マップを拡大して精度を向上させるため None 7. MobileNetV3で導入された「ハードスワッシュ」とReLU6を比較した場合、どのような性能向上が期待されますか? ハードスワッシュは、ReLU6よりも計算効率が高く、表現力が向上する ハードスワッシュは、ReLU6よりも計算コストが高いが精度が向上する ハードスワッシュは、ReLU6と同様のパフォーマンスを持つ ReLU6は、ハードスワッシュよりも効率が良い None 8. GoogLeNetの出力層の設計に関して、正しい説明は次のうちどれですか? Softmax活性化関数を使用して、各クラスの確率を出力する ReLUを使用してクラス間の差異を明確にする Linear活性化関数を使用して連続値を出力する Tanh関数を使用して二値分類を行う None 9. seq2seqモデルで「デコーダ」が生成するのは何ですか? 入力シーケンスの次元数 出力シーケンス モデルの重み エンコーダの隠れ状態 None 10. EfficientNetの「Compound Scaling」の理論的根拠は何ですか? モデルの幅を最も重要視するという理論に基づいている 深さのみをスケーリングすることが効率的であるという仮定に基づいている 解像度をスケールするだけで精度が向上するという考え方に基づいている 各要素(幅、深さ、解像度)が異なるスケールで同等に性能に影響を与えるという仮定に基づいている None 11. DenseNetの「密結合」構造において、層ごとに出力される特徴が前層の出力と統合されることによって得られる効果は何ですか? モデルのパラメータ数が増加する 層ごとに冗長な特徴を抽出し、精度が向上する 学習速度が遅くなる 特徴の再利用によって、効率的な学習が行われ、より高い性能が得られる None 12. Transformerモデルにおいて「エンコーダスタック」と「デコーダスタック」の役割の違いは何ですか? エンコーダは出力シーケンスを生成し、デコーダは入力シーケンスをエンコードする エンコーダはアテンションを無視し、デコーダはアテンションを利用する エンコーダは入力シーケンスをエンコードし、デコーダはエンコーダの出力に基づいて出力シーケンスを生成する エンコーダは出力シーケンスをシャッフルし、デコーダは元に戻す None 13. EfficientNetの「Compound Scaling」を調整する際、幅を大きくスケーリングしすぎるとどのような問題が発生しますか? モデルの深さが減少し、学習が不安定になる 計算コストが減少しすぎ、精度が著しく低下する 特徴マップのチャネル数が減少しすぎて、表現力が低下する モデルの計算コストが大幅に増加し、効率が低下する None 14. DenseNetにおいて「トランジションレイヤー」が適切に設計されていない場合、どのような問題が発生しますか? 特徴マップが過度に大きくなり、計算効率が悪化する モデルのパラメータ数が減少しすぎて精度が低下する 勾配消失が発生しやすくなる モデルが学習しなくなる None 15. DenseNetの「密結合」構造が、他のモデルと比較してパラメータ効率を向上させる理由は何ですか? 各層が残差接続を使用しているため 活性化関数をReLUからLeaky ReLUに変更しているため 各層が新しいパラメータを必要とせず、既存の特徴を再利用するため 特徴マップの解像度を一定に保っているため None 16. GoogLeNetの設計で「プーリング層」を使用する主な目的は何ですか? パラメータ数を増やすため モデルの計算速度を低下させるため 特徴マップのサイズを縮小し、重要な特徴を強調するため 活性化関数を最適化するため None 17. GoogLeNetが従来のCNNモデルよりも効率的に計算できる理由は何ですか? モデルの層が浅いため 1x1の畳み込みによる次元削減が計算量を大幅に削減するため 重みがランダムに初期化されているため プーリング層が使用されていないため None 18. HREDモデルの生成した応答が一貫性を欠く場合、どのような改善策が考えられますか? モデルの出力を正規化する コンテキストエンコーダにアテンション機構を導入し、文脈の重要な部分に注意を向けさせる モデルのパラメータを増やす モデルの訓練データを減らす None 19. 「クロスアテンション」とは何ですか? 自己注意機構と同様に動作し、入力シーケンス内の関係性を学習する デコーダ内でのみ使用されるアテンション機構 エンコーダとデコーダ間で異なるシーケンスに対して注意を向ける機構 同じシーケンス内で注意を向ける機構 None 20. Word2VecのSkip-gramモデルにおいて「ウィンドウサイズ」の役割は何ですか? モデルの出力サイズを決定する 中心語から何語までを文脈語として考慮するかを決める モデルの学習率を決定する 単語ベクトルの次元数を決定する None 21. VGGネットワークが「事前学習済みモデル」としてよく使用される理由は何ですか? モデルが軽量であるため ネットワークの深さが浅いため パラメータ数が少ないため 多くの異なる画像データセットで良好な性能を発揮するため None 22. seq2seqモデルにおいて、入力シーケンスの長さが異なるデータを処理するために最も適している手法はどれですか? 固定長のベクトルに入力シーケンスを切り捨てる パディングを使い、入力シーケンスを同じ長さに揃える 全ての入力シーケンスを同じ長さのデータに変換する 入力シーケンスを無視する None 23. Transformerモデルにおいて「残差接続(Residual Connection)」の目的は何ですか? モデルの重みを削減するため モデルの学習速度を向上させるため データの前処理を自動化するため 各層の出力に入力を加算し、勾配消失を防ぎ、深いネットワークでも学習を安定化させるため None 24. HREDモデルにおいて「デコーダ」の役割は何ですか? コンテキストエンコーダの出力に基づいて、次の文や発話を生成する 各単語をエンコードする モデルの損失関数を計算する モデルの学習率を調整する None 25. VGGネットワークの層の総数が多い理由は何ですか? 複雑な画像処理をシンプルにするため 各層で異なるレベルの特徴を学習し、高次の抽象的特徴を得るため 各層のパラメータ数を減らすため モデルの訓練を容易にするため None 26. 自己回帰型Transformerモデルにおいて「学習時と推論時のギャップ」を軽減する手法はどれですか? スケジュールサンプリング ビームサーチ 正則化 ドロップアウト None 27. GoogLeNetモデルの主な特徴は次のうちどれですか? 全結合層の数を増やしたモデル Inceptionモジュールを使用し、畳み込みとプーリングを並列に処理する ReLUを活性化関数として使用しないモデル 深さが浅いCNNモデル None 28. MobileNetの効率的な設計において、「次元削減」の目的は何ですか? 計算コストを削減しながら、特徴マップの表現力を維持するため モデルの学習速度を遅くするため 残差接続を使用するため 勾配消失を引き起こすため None 29. VGGネットワークの設計において「全結合層」を使用する目的は何ですか? 特徴マップのサイズを減らすため 畳み込み層で抽出した特徴を元に、最終的なクラス分類を行うため モデルのパラメータ数を削減するため 活性化関数を変更するため None 30. WideResNetのようなモデルで「スキップ接続」が無い場合、どのような影響が考えられますか? モデルの性能が向上する モデルのパラメータ数が増加する 学習速度が向上する 勾配消失問題が悪化し、学習が進まなくなる可能性がある None 31. MobileNetの設計において、「ハイパーパラメータα(アルファ)」は何を調整するために使用されますか? モデルの深さを調整する 活性化関数の種類を決定する モデルの幅(チャネル数)を調整し、計算コストと精度をバランスさせる モデルの学習率を最適化する None 32. GoogLeNetの「Inceptionモジュール」の設計において、次元削減を行わないとどのような影響がありますか? モデルの性能が向上する モデルのパラメータ数が減少する モデルの学習速度が向上する モデルの計算量が増加し、メモリ使用量が大幅に増加する None 33. GoogLeNetの設計において「枝分かれしたネットワーク(分岐)」を採用する理由は何ですか? モデルの計算速度を向上させるため モデルのパラメータ数を削減するため 単一の出力に依存することを防ぐため 異なる解像度で特徴を学習し、モデルの汎用性を高めるため None 34. GPT-3のような自己回帰型モデルにおいて「注意欠陥」が起こる理由は何ですか? モデルが過去の情報に過剰に依存しすぎるため モデルが同じトークンに繰り返し注意を向けるため モデルが次のトークンを生成する際に、遠い過去の情報を無視する可能性があるため モデルが文法的な構造を理解しないため None 35. GoogLeNetの設計において、Inceptionモジュールを使用する利点は何ですか? 全ての特徴を1つのカーネルサイズで学習する 畳み込み層のパラメータ数を増やす 異なるサイズの特徴を同時に学習し、より多様な特徴抽出が可能になる モデルの学習速度を低下させる None 36. GoogLeNetにおいて、各Inceptionモジュールで「3x3の畳み込み層」を使用する理由は何ですか? 計算コストを削減するため 特徴マップのチャネル数を増やすため プーリング層の代わりに使用されるため 中間的なサイズの特徴を学習し、細かいパターンを捉えるため None 37. MobileNetにおいて「Depthwise Separable Convolution」の主な利点は何ですか? ネットワークの層数を増やすため 計算量とパラメータ数を削減するため 特徴抽出能力を低下させるため モデルの学習速度を遅くするため None 38. Transformerモデルで用いられる「FFN(Feed-Forward Network)」の役割は何ですか? エンコーダとデコーダの出力を統合するため 各単語に対して非線形変換を適用し、モデルの表現力を向上させるため モデルの計算コストを削減するため モデルの学習率を最適化するため None 39. DenseNetが非常に深いネットワークにおいても「勾配消失」を防げる主な理由は何ですか? 各層が前の全ての層と接続され、勾配が効果的に伝播するため 活性化関数が使用されていないため モデルが浅く設計されているため トランジションレイヤーが全ての層に適用されるため None 40. HREDモデルにおいて「情報ボトルネック問題」が発生する可能性がある理由は何ですか? モデルが過去の対話を全て記憶するため モデルが同じ応答を繰り返し生成するため コンテキストエンコーダが全ての情報を1つのベクトルに圧縮するため、長い対話では情報が失われやすくなるため モデルの計算コストが高いため None 41. EfficientNetにおいて「MBConvブロック」の設計が計算効率を高める理由は何ですか? 残差接続とリニアボトルネックを組み合わせて計算量を減少させるため 畳み込み層を完全に除去しているため モデルの幅を減少させているため 活性化関数を変更しているため None 42. DenseNetが「パラメータの再利用」により他のモデルよりも効率的である理由は何ですか? 残差接続を用いているため 各層が独立して学習を行うため モデルの深さを増やしているため 各層が前の全ての層の出力を使用し、新しいパラメータを最小限に抑えるため None 43. HREDモデルが「対話システム」において持つ最大の利点は何ですか? 訓練時間を短縮できる 過去の対話の文脈を長期間にわたり保持し、文脈に基づいた応答を生成できる 生成する応答を短縮できる 各発話を独立して処理できる None 44. Transformerモデルにおいて、「マルチヘッドアテンション」が持つ効果は何ですか? 訓練データのサイズを削減する モデルの各層の出力を全て同時に計算する 複数の異なるアテンションを並行して学習し、文脈の多様な側面を捉える デコーダが全ての入力シーケンスをシャッフルする None 45. VGGネットワークのような深層学習モデルで、深い層を追加する際に発生する「勾配消失問題」を解決するための手法はどれですか? ReLU活性化関数を使用する 重み減衰を適用する 全結合層を削除する バッチ正規化を導入する None 46. seq2seqモデルにおいて、LSTM(Long Short-Term Memory)がRNNに比べて優れている点は何ですか? 訓練データのサイズを自動的に削減できる 勾配消失問題を軽減し、長期的な依存関係を学習できる モデルの学習速度を向上させる 出力の次元数を減らす None 47. EfficientNetが「Squeeze-and-Excitation(SE)」ブロックを導入している理由は何ですか? パラメータ数を削減するため 各チャネルの重要度を学習し、適応的に重み付けを行うため 特徴マップのサイズを拡大するため 活性化関数を変更するため None 48. Word2VecのSkip-gramモデルにおける「ウィンドウサイズ」が大きすぎると、どのような問題が発生する可能性がありますか? 単語の類似性が低下する ノイズが増加し、関連性の低い単語が学習される可能性がある モデルのパラメータが減少する 単語の出現回数が増加する None 49. ResNet/WideResNetにおける「Global Average Pooling(GAP)」の使用は何を目的としていますか? パラメータ数を増加させるため 最終的な特徴マップを集約し、過学習を防ぐため 特徴マップのサイズを増加させるため 勾配消失問題を軽減するため None 50. seq2seqモデルにおいて「エンコーダ」の役割は何ですか? 入力シーケンスを受け取り、隠れ状態に変換する 出力シーケンスを生成する モデルの重みを最適化する 入力データの次元を削減する None Time's up