AI実装検定S級~模擬試験~ 2024年11月3日 ailearn 1. VGGネットワークで「転移学習」が効果的な理由は何ですか? モデルが浅いネットワーク構造を持つため 事前学習された特徴が多くの異なるタスクに対して汎用的であるため モデルのパラメータ数が少ないため モデルが固定された出力サイズを持つため None 2. DenseNetで「成長率(Growth Rate)」が過度に高く設定されると、どのような問題が発生する可能性がありますか? モデルのパラメータ数が増加し、メモリ使用量が大幅に増える 計算コストが減少し、性能が低下する 成長率が高いほどモデルの性能が向上するため問題は発生しない モデルが浅くなり、学習が進まない None 3. seq2seqモデルにおける「双方向エンコーダ(Bidirectional Encoder)」の利点は何ですか? モデルの計算コストを削減するため デコーダの性能を向上させるため 入力シーケンスを前方向と後方向の両方から処理し、文脈の理解を深めるため モデルの訓練時間を短縮するため None 4. 「クロスアテンション」とは何ですか? 自己注意機構と同様に動作し、入力シーケンス内の関係性を学習する デコーダ内でのみ使用されるアテンション機構 エンコーダとデコーダ間で異なるシーケンスに対して注意を向ける機構 同じシーケンス内で注意を向ける機構 None 5. VGGネットワークが「事前学習済みモデル」としてよく使用される理由は何ですか? モデルが軽量であるため ネットワークの深さが浅いため パラメータ数が少ないため 多くの異なる画像データセットで良好な性能を発揮するため None 6. Word2VecモデルのSkip-gramとCBOW(Continuous Bag of Words)の主な違いは何ですか? Skip-gramは文全体を入力とし、CBOWは単語のみを入力とする Skip-gramは文脈語から中心語を予測し、CBOWは中心語から文脈語を予測する Skip-gramは畳み込み層を使用し、CBOWは使用しない Skip-gramは単語間の関係を無視するが、CBOWは関係を考慮する None 7. EfficientNetにおける「Squeeze-and-Excitation(SE)」ブロックを適用することで期待できる効果は何ですか? パラメータ数が削減され、計算コストが減少する チャネルごとの重要度を学習し、精度が向上する 計算コストが大幅に増加する モデルのスケーリングが無効になる None 8. DenseNetの「密結合」構造が、他のモデルと比較してパラメータ効率を向上させる理由は何ですか? 各層が残差接続を使用しているため 活性化関数をReLUからLeaky ReLUに変更しているため 各層が新しいパラメータを必要とせず、既存の特徴を再利用するため 特徴マップの解像度を一定に保っているため None 9. MobileNetの「Depthwise Separable Convolution」と従来の畳み込み層を比較した場合、パラメータ数の削減率はどの程度ですか? 約10% 約50% 約75% 約90% None 10. GoogLeNetの訓練において、学習率スケジューリングを使用する理由は何ですか? モデルの訓練時間を増やすため モデルのパラメータ数を増やすため 学習が進むにつれて学習率を徐々に減少させ、最適な収束を促すため 勾配消失問題を防ぐため None 11. HREDモデルの訓練時に「長短期記憶(LSTM)」と「ゲート付きリカレントユニット(GRU)」のどちらを使用するか選択する際のポイントは何ですか? モデルのパラメータ数がLSTMよりもGRUの方が少なく、計算が高速になるため LSTMの方がGRUよりも常に優れているため GRUは勾配消失問題を完全に解決できるため GRUは学習速度が遅いため None 12. GoogLeNetにおいて「1x1畳み込み」の役割は何ですか? 特徴マップのサイズを縮小するため モデルの計算量を減少させるため 次元削減を行い、計算効率を向上させるため モデルのパラメータ数を増加させるため None 13. VGGネットワークが通常使用する活性化関数は何ですか? Sigmoid関数 Tanh関数 ReLU(Rectified Linear Unit)関数 Softmax関数 None 14. HREDモデルにおいて「対話型システム」でよく使用される理由は何ですか? 生成された文を短縮できる 音声認識に特化しているため ユーザーの過去の発話や文脈を保持し、より自然な応答を生成できるため モデルのパラメータ数が少ないため None 15. Word2VecのSkip-gramモデルにおける「softmax関数」の役割は何ですか? モデルの出力を正規化し、各文脈語に対する確率を計算するため モデルのパラメータを初期化するため モデルの損失関数を計算するため モデルの学習速度を向上させるため None 16. HREDモデルにおいて「デコーダ」の役割は何ですか? コンテキストエンコーダの出力に基づいて、次の文や発話を生成する 各単語をエンコードする モデルの損失関数を計算する モデルの学習率を調整する None 17. EfficientNetのスケーリング戦略である「Compound Scaling」の目的は何ですか? 計算コストを無視して最大限の精度を追求するため 幅、深さ、解像度をバランスよく拡大し、効率的に精度を向上させるため モデルのパラメータ数を削減するため モデルの訓練時間を短縮するため None 18. DenseNetで「スキップ接続」が無い場合に発生しうる問題は何ですか? 勾配消失問題が発生しやすくなり、学習が進まなくなる モデルのパラメータ数が大幅に減少する 特徴マップのチャネル数が増加する モデルの学習速度が著しく向上する None 19. HREDモデルの訓練でよく使用される損失関数は次のうちどれですか? 平均二乗誤差 ヒンジ損失 L2正則化 クロスエントロピー損失 None 20. HREDモデルの「グローバル文脈」と「ローカル文脈」の役割を正しく説明したものはどれですか? グローバル文脈は各文の詳細を扱い、ローカル文脈は全体の流れを保持する グローバル文脈は長期的な文脈を保持し、ローカル文脈は現在の文や発話の情報を保持する グローバル文脈は現在の文の情報を保持し、ローカル文脈は長期的な文脈を扱う グローバル文脈は文の出力を生成し、ローカル文脈は入力シーケンスをエンコードする None 21. EfficientNetが「軽量」でありながら「高精度」を実現できる理由は何ですか? MBConvブロック、リニアボトルネック、SEブロックの効率的な組み合わせによるため 全結合層を使用していないため 活性化関数をReLUからSigmoidに変更したため モデルの深さを無限に増やせるため None 22. WideResNetのようなモデルで「スキップ接続」が無い場合、どのような影響が考えられますか? モデルの性能が向上する モデルのパラメータ数が増加する 学習速度が向上する 勾配消失問題が悪化し、学習が進まなくなる可能性がある None 23. EfficientNetにおいて「MBConvブロック」の設計が計算効率を高める理由は何ですか? 残差接続とリニアボトルネックを組み合わせて計算量を減少させるため 畳み込み層を完全に除去しているため モデルの幅を減少させているため 活性化関数を変更しているため None 24. DenseNetの「トランジションレイヤー」において、プーリング操作が行われる理由は何ですか? 特徴マップの解像度を縮小し、計算コストを削減するため 特徴マップのチャネル数を増やすため モデルのパラメータ数を削減するため 勾配消失を防ぐため None 25. seq2seqモデルにおいて、入力シーケンスの長さが異なるデータを処理するために最も適している手法はどれですか? 固定長のベクトルに入力シーケンスを切り捨てる パディングを使い、入力シーケンスを同じ長さに揃える 全ての入力シーケンスを同じ長さのデータに変換する 入力シーケンスを無視する None 26. DenseNetが「勾配消失問題」を効果的に防ぐ理由は何ですか? 各層が残差接続を使用しているため モデルの深さが浅いため 全ての層が前の層から直接情報を受け取る密結合構造を持つため 活性化関数を使用していないため None 27. Word2VecのSkip-gramモデルにおける「学習率」を最適化する理由は何ですか? モデルの出力を正規化するため 過学習を防ぐため モデルが最適なパラメータ更新を行い、効率的に収束するため モデルの計算速度を増加させるため None 28. EfficientNetにおいて「Global Average Pooling(GAP)」が使用される理由は何ですか? パラメータ数を減らし、過学習を防ぐため 特徴マップを拡大して精度を向上させるため モデルの幅をスケーリングするため 活性化関数を無効にするため None 29. GoogLeNetの「auxiliary classifiers」を使用しない場合、どのような影響がありますか? モデルの勾配消失問題が悪化する可能性がある モデルの性能が向上する モデルの訓練速度が向上する モデルのパラメータ数が減少する None 30. DenseNetにおける「成長率(Growth Rate)」は何を示していますか? 各層で新たに追加されるフィルタ数 ネットワーク全体の層数 モデルの学習速度 畳み込み層のカーネルサイズ None 31. BERTモデルで使用される「マスク付き言語モデル(MLM)」の目的は何ですか? モデルの重みを削減するため 一部の単語を隠し、それを予測するタスクを通じて文脈を学習させるため モデルの学習速度を向上させるため モデルのサイズを最適化するため None 32. Word2VecのSkip-gramモデルにおいて「ウィンドウサイズ」の役割は何ですか? モデルの出力サイズを決定する 中心語から何語までを文脈語として考慮するかを決める モデルの学習率を決定する 単語ベクトルの次元数を決定する None 33. EfficientNetの「Compound Scaling」を調整する際、幅を大きくスケーリングしすぎるとどのような問題が発生しますか? モデルの深さが減少し、学習が不安定になる 計算コストが減少しすぎ、精度が著しく低下する 特徴マップのチャネル数が減少しすぎて、表現力が低下する モデルの計算コストが大幅に増加し、効率が低下する None 34. ResNetの「学習率スケジューリング」が訓練において重要である理由は何ですか? 学習の初期段階で大きな学習率を使用し、後半では小さな学習率を使用して最適な収束を促すため 学習率を一定に保つため 勾配消失問題を解決するため モデルのパラメータ数を増加させるため None 35. MobileNetが「軽量」でありながら「高精度」を維持できる理由は次のうちどれですか? モデルの深さを増やしているため 分離可能な畳み込み(Depthwise Separable Convolution)や次元削減を効率的に使用しているため 全ての層でReLUを使用しているため 残差接続を多用しているため None 36. VGGネットワークで「カーネルサイズを小さくする」設計の意図は何ですか? モデルの精度を低下させるため 訓練データを削減するため パラメータ数を削減しながら、同等の受容野を確保するため モデルの出力サイズを変更するため None 37. MobileNetV3で新たに採用された「ハードスワッシュ(Hard-Swish)」の活性化関数は、何を改善するために使用されますか? ReLU6の計算効率をさらに向上させるため ネガティブな出力を増加させるため 特徴抽出のための出力範囲を広げるため 活性化関数の非線形性を減らすため None 38. Transformerモデルにおいて、「マルチヘッドアテンション」が持つ効果は何ですか? 訓練データのサイズを削減する モデルの各層の出力を全て同時に計算する 複数の異なるアテンションを並行して学習し、文脈の多様な側面を捉える デコーダが全ての入力シーケンスをシャッフルする None 39. ResNetで「勾配消失問題」を防ぐための他の手法として考えられるものは次のうちどれですか? 全結合層を削除する 残差接続を無効にする バッチ正規化を導入する パラメータをランダムに初期化する None 40. HREDモデルが「対話システム」において持つ最大の利点は何ですか? 訓練時間を短縮できる 過去の対話の文脈を長期間にわたり保持し、文脈に基づいた応答を生成できる 生成する応答を短縮できる 各発話を独立して処理できる None 41. Skip-gramモデルの学習において「ネガティブサンプリング」の目的は何ですか? モデルの学習率を最適化する 計算コストを削減しながら、モデルの精度を維持するため 単語ベクトルの次元数を増やすため 文脈語の出現頻度を増やすため None 42. VGGネットワークが多くのパラメータを持つことの欠点を軽減するために、近年利用される技術は何ですか? データ拡張 モデルの蒸留 転移学習 プルーニング(剪定) None 43. DenseNetにおける「トランジションレイヤー」の畳み込み操作は何を目的としていますか? パラメータ数を増やし、学習を促進するため 特徴マップの解像度を増加させるため 特徴マップの次元を減少させ、メモリ使用量を抑えるため モデルの幅を調整するため None 44. Word2VecのSkip-gramモデルにおける「ウィンドウサイズ」が大きすぎると、どのような問題が発生する可能性がありますか? 単語の類似性が低下する ノイズが増加し、関連性の低い単語が学習される可能性がある モデルのパラメータが減少する 単語の出現回数が増加する None 45. Transformerモデルのトレーニングにおいて「学習率ウォームアップ」を使用する理由は何ですか? モデルの学習を開始する前に、学習率を徐々に増加させて安定した学習を行うため モデルの重みを初期化するため モデルの過学習を防ぐため データの正規化を行うため None 46. EfficientNetの「スケーリング係数φ(フィー)」が調整するのは次のうちどれですか? モデルの学習率 全結合層の数 活性化関数の種類 モデルの深さ、幅、解像度のバランス None 47. DenseNetの「密結合」構造において、層ごとに出力される特徴が前層の出力と統合されることによって得られる効果は何ですか? モデルのパラメータ数が増加する 層ごとに冗長な特徴を抽出し、精度が向上する 学習速度が遅くなる 特徴の再利用によって、効率的な学習が行われ、より高い性能が得られる None 48. DenseNetが他の深層学習モデルに比べて「メモリ効率が高い」と言われる理由は何ですか? モデルのパラメータ数が少ないため トランジションレイヤーが全ての層に適用されているため 特徴マップのサイズを一定に保っているため 各層が特徴マップを再利用し、不要な計算を減らしているため None 49. Transformerモデルにおいて、「位置的注意スコア」はどのように計算されますか? 出力とターゲットシーケンスの距離に基づいて計算される エンコーダとデコーダの出力を直接比較する モデルの重みから自動計算される クエリとキーの内積を計算し、それをソフトマックスで正規化する None 50. 自己回帰型Transformerモデルにおいて「学習時と推論時のギャップ」を軽減する手法はどれですか? スケジュールサンプリング ビームサーチ 正則化 ドロップアウト None Time's up