AI実装検定S級~模擬試験~ 2024年11月3日 ailearn 1. HREDモデルにおける「コンテキストエンコーダ」の役割は何ですか? 全体の文脈情報をエンコードし、各文の情報を統合する 各文の意味をエンコードする モデルの重みを最適化する モデルの学習率を調整する None 2. MobileNetが主に使用されるアプリケーション分野はどれですか? モバイル端末や組み込みシステムなどの計算資源が限られた環境 高性能なサーバーでのバッチ処理 大規模なデータセットのトレーニング 分散コンピューティング環境 None 3. VGGネットワークで「転移学習」が効果的な理由は何ですか? モデルが浅いネットワーク構造を持つため 事前学習された特徴が多くの異なるタスクに対して汎用的であるため モデルのパラメータ数が少ないため モデルが固定された出力サイズを持つため None 4. ResNetが「オーバーフィッティング」を防ぐために使用する手法は次のうちどれですか? ドロップアウト 残差接続 正則化 L2正則化 None 5. ResNet/WideResNetにおける「Global Average Pooling(GAP)」の使用は何を目的としていますか? パラメータ数を増加させるため 最終的な特徴マップを集約し、過学習を防ぐため 特徴マップのサイズを増加させるため 勾配消失問題を軽減するため None 6. MobileNetが「軽量」でありながら「高精度」を維持できる理由は次のうちどれですか? モデルの深さを増やしているため 分離可能な畳み込み(Depthwise Separable Convolution)や次元削減を効率的に使用しているため 全ての層でReLUを使用しているため 残差接続を多用しているため None 7. GPT(Generative Pre-trained Transformer)モデルがBERTとは異なる点は何ですか? GPTは双方向の文脈を同時に学習するが、BERTは単方向の文脈しか学習しない GPTは単方向の文脈を学習し、テキスト生成タスクに特化している GPTはエンコーダのみを使用し、BERTはデコーダのみを使用する GPTは翻訳タスク専用で、BERTは分類タスク専用である None 8. MobileNetV3で導入された「ハードスワッシュ」とReLU6を比較した場合、どのような性能向上が期待されますか? ハードスワッシュは、ReLU6よりも計算効率が高く、表現力が向上する ハードスワッシュは、ReLU6よりも計算コストが高いが精度が向上する ハードスワッシュは、ReLU6と同様のパフォーマンスを持つ ReLU6は、ハードスワッシュよりも効率が良い None 9. DenseNetが非常に深いネットワークにおいても「勾配消失」を防げる主な理由は何ですか? 各層が前の全ての層と接続され、勾配が効果的に伝播するため 活性化関数が使用されていないため モデルが浅く設計されているため トランジションレイヤーが全ての層に適用されるため None 10. HREDモデルの「グローバル文脈」と「ローカル文脈」の役割を正しく説明したものはどれですか? グローバル文脈は各文の詳細を扱い、ローカル文脈は全体の流れを保持する グローバル文脈は長期的な文脈を保持し、ローカル文脈は現在の文や発話の情報を保持する グローバル文脈は現在の文の情報を保持し、ローカル文脈は長期的な文脈を扱う グローバル文脈は文の出力を生成し、ローカル文脈は入力シーケンスをエンコードする None 11. WideResNetの幅を増やすことによる「表現力」の向上が、どのようにモデルの性能に影響を与える可能性がありますか? 残差接続が無効になる 表現力が向上することで、より多様な特徴を学習しやすくなり、精度が向上する モデルの精度が低下する 勾配消失問題が発生する None 12. seq2seqモデルにおいて、「学習時のスケジュールサンプリング」が持つ効果は何ですか? モデルの学習速度を速めるため モデルのパラメータ数を減少させるため 訓練時にモデルが予測したトークンを使い、実運用に近い形で学習するため モデルのハイパーパラメータを自動的に最適化するため None 13. VGGネットワークの「小さな3x3カーネル」を使用することの利点は何ですか? より大きなカーネルサイズを使用した場合と同じ受容野を確保しつつ、パラメータ数を抑えるため モデルの計算量を削減するため 訓練データを削減するため モデルの過学習を防ぐため None 14. seq2seqモデルのエンコーダにおいて、「長短期記憶(LSTM)」を用いるメリットとして正しいものはどれですか? モデルの学習時間を短縮できる 長期的な依存関係を保持しやすく、勾配消失問題を回避できる デコーダの出力を最適化する パディングを行わずに入力シーケンスを処理できる None 15. MobileNetV2の「インバーテッド残差構造」が従来の残差構造と異なる点は何ですか? 残差接続を削除している 全ての層でReLUを使用していない 非線形活性化を使用していない 高次元空間での特徴抽出後に次元削減を行う None 16. Word2VecのSkip-gramモデルで「文脈が不明な単語」を効果的に処理するために使用される技術は何ですか? 文脈を複数のサンプルに分割して、異なる文脈で単語を学習させる 単語のシャッフリング 単語ベクトルの次元数を増やす 文法的ルールを適用する None 17. Skip-gramモデルで、負のサンプリング(Negative Sampling)を使用する際に最も重要なハイパーパラメータは何ですか? バッチサイズ 学習率 ウィンドウサイズ サンプリングの負例の数 None 18. DenseNetの「密結合」構造が、他のモデルと比較してパラメータ効率を向上させる理由は何ですか? 各層が残差接続を使用しているため 活性化関数をReLUからLeaky ReLUに変更しているため 各層が新しいパラメータを必要とせず、既存の特徴を再利用するため 特徴マップの解像度を一定に保っているため None 19. VGGネットワークにおける「ゼロパディング」の主な役割は何ですか? 特徴マップのサイズを固定し、畳み込み層で情報の損失を防ぐため モデルの訓練時間を短縮するため モデルの出力をシャッフルするため モデルの重みを初期化するため None 20. WideResNetが「深さ」を増やす代わりに「幅」を増やす選択をする理由は何ですか? 訓練データの量を減らすため 計算量を削減するため 勾配消失問題を軽減しつつ、より多様な特徴を学習するため モデルのパラメータ数を減らすため None 21. HREDモデルにおいて「対話型システム」でよく使用される理由は何ですか? 生成された文を短縮できる 音声認識に特化しているため ユーザーの過去の発話や文脈を保持し、より自然な応答を生成できるため モデルのパラメータ数が少ないため None 22. EfficientNetの「Compound Scaling」の理論的根拠は何ですか? モデルの幅を最も重要視するという理論に基づいている 深さのみをスケーリングすることが効率的であるという仮定に基づいている 解像度をスケールするだけで精度が向上するという考え方に基づいている 各要素(幅、深さ、解像度)が異なるスケールで同等に性能に影響を与えるという仮定に基づいている None 23. MobileNetにおいて、分類タスクで「Global Average Pooling(GAP)」を使用する主な目的は何ですか? モデルのパラメータ数を増やすため 特徴マップを平均化し、全結合層の代わりに出力を生成するため 活性化関数を変更するため 特徴マップのチャネル数を削減するため None 24. HREDモデルの基本的な構造は次のうちどれですか? 単一のRNNエンコーダとデコーダ 階層的に複数のエンコーダとデコーダを持つモデル 畳み込みニューラルネットワーク(CNN)を使用したモデル 自己注意機構を使用したTransformerモデル None 25. Skip-gramモデルの学習において「ネガティブサンプリング」の目的は何ですか? モデルの学習率を最適化する 計算コストを削減しながら、モデルの精度を維持するため 単語ベクトルの次元数を増やすため 文脈語の出現頻度を増やすため None 26. 自己回帰型Transformerモデルにおいて「学習時と推論時のギャップ」を軽減する手法はどれですか? スケジュールサンプリング ビームサーチ 正則化 ドロップアウト None 27. MobileNetで「1x1の畳み込み(Pointwise Convolution)」が使用される目的は何ですか? 各チャネルの情報を統合し、出力チャネルを生成するため モデルのパラメータ数を増加させるため モデルの学習速度を遅くするため 特徴マップのサイズを拡大するため None 28. VGGネットワークの設計において「全結合層」を使用する目的は何ですか? 特徴マップのサイズを減らすため 畳み込み層で抽出した特徴を元に、最終的なクラス分類を行うため モデルのパラメータ数を削減するため 活性化関数を変更するため None 29. DenseNetにおいて「ブロック(Block)」はどのような役割を果たしますか? それぞれのブロック内で独立した学習を行う パラメータの数を大幅に減少させる 他のブロックと直接的に情報を交換しない 同じ特徴を再利用し、計算量を増やさずに学習を進める None 30. GoogLeNetで「Global Average Pooling(GAP)」が使用される理由は何ですか? 全結合層を削減し、過学習を防ぐため 特徴マップのサイズを増やすため 活性化関数を最適化するため モデルの計算速度を低下させるため None 31. HREDのような階層型モデルが一般的なRNNに比べて長期依存関係を捉えるのに優れている理由は何ですか? モデルのパラメータ数が少ないため 訓練時間が短いため 全てのシーケンスが並列処理されるため 階層構造によって文や発話単位の依存関係を保持しやすいため None 32. seq2seqモデルにおいて、LSTM(Long Short-Term Memory)がRNNに比べて優れている点は何ですか? 訓練データのサイズを自動的に削減できる 勾配消失問題を軽減し、長期的な依存関係を学習できる モデルの学習速度を向上させる 出力の次元数を減らす None 33. VGGネットワークで「カーネルサイズを小さくする」設計の意図は何ですか? モデルの精度を低下させるため 訓練データを削減するため パラメータ数を削減しながら、同等の受容野を確保するため モデルの出力サイズを変更するため None 34. VGGネットワークを転移学習に使用する際、全結合層を新しいタスクに合わせて再トレーニングする理由は何ですか? 全結合層は画像全体の意味を捉えるため、他のタスクに対応する必要があるから 全結合層は学習済みの重みを使えないため 全結合層の活性化関数が異なるため 全結合層は事前学習に含まれないため None 35. EfficientNetの「Compound Scaling」を調整する際、幅を大きくスケーリングしすぎるとどのような問題が発生しますか? モデルの深さが減少し、学習が不安定になる 計算コストが減少しすぎ、精度が著しく低下する 特徴マップのチャネル数が減少しすぎて、表現力が低下する モデルの計算コストが大幅に増加し、効率が低下する None 36. EfficientNet-B0が他のEfficientNetシリーズよりも軽量である理由は何ですか? Compound Scalingの基準となるモデルで、パラメータ数が少ないため モデルの幅と解像度が固定されているため より多くの畳み込み層を使用しているため ストライド2の畳み込みが多用されているため None 37. ResNetの設計において、最大の特徴である「残差接続(Residual Connection)」の目的は何ですか? モデルの計算コストを削減するため 非線形性を増加させるため 勾配消失問題を軽減し、深い層でも学習が安定するようにするため モデルのパラメータ数を増加させるため None 38. seq2seqモデルにおいて、「BLEUスコア」とは何を測定する指標ですか? モデルの出力シーケンスの生成速度 生成されたシーケンスが、ターゲットシーケンスとどれだけ一致しているかを測定する指標 モデルの損失関数の値 モデルのハイパーパラメータの最適性 None 39. seq2seqモデルで使用される基本的なアーキテクチャはどれですか? 畳み込みニューラルネットワーク (CNN) 再帰型ニューラルネットワーク (RNN) ガウス過程 (Gaussian Process) ランダムフォレスト (Random Forest) None 40. HREDモデルの訓練でよく使用される損失関数は次のうちどれですか? 平均二乗誤差 ヒンジ損失 L2正則化 クロスエントロピー損失 None 41. Skip-gramモデルで単語ベクトルが生成される際、どのように単語の意味的類似性が表現されますか? 単語の出現頻度に基づいてベクトルが作成される 文法的な関係がベクトルの距離に影響を与える 意味が類似した単語同士は、ベクトル空間上で近い位置に配置される 単語のアルファベット順にベクトルが作成される None 42. EfficientNetにおいて「Global Average Pooling(GAP)」が使用される理由は何ですか? パラメータ数を減らし、過学習を防ぐため 特徴マップを拡大して精度を向上させるため モデルの幅をスケーリングするため 活性化関数を無効にするため None 43. seq2seqモデルにおける「双方向エンコーダ(Bidirectional Encoder)」の利点は何ですか? モデルの計算コストを削減するため デコーダの性能を向上させるため 入力シーケンスを前方向と後方向の両方から処理し、文脈の理解を深めるため モデルの訓練時間を短縮するため None 44. DenseNetで「成長率(Growth Rate)」が過度に高く設定されると、どのような問題が発生する可能性がありますか? モデルのパラメータ数が増加し、メモリ使用量が大幅に増える 計算コストが減少し、性能が低下する 成長率が高いほどモデルの性能が向上するため問題は発生しない モデルが浅くなり、学習が進まない None 45. EfficientNetが従来のモデルよりも計算効率が高い理由は何ですか? 全ての畳み込み層でストライド2を使用しているため モデルの層数を削減しているため Compound Scalingにより、計算コストを抑えつつ精度を向上させているため 活性化関数を変更したため None 46. DenseNetにおいて「バッチ正規化(Batch Normalization)」が使用される主な理由は何ですか? 各層の出力を正規化し、学習の安定性を向上させるため パラメータ数を減らすため モデルの解像度を上げるため 特徴マップのサイズを増やすため None 47. GoogLeNetが「事前学習済みモデル」として広く使用される理由は何ですか? モデルが軽量であるため 事前学習された特徴が他のタスクに適用できないため 異なる画像データセットに対しても高い性能を発揮するため モデルの層が浅いため None 48. seq2seqモデルで「デコーダ」が生成するのは何ですか? 入力シーケンスの次元数 出力シーケンス モデルの重み エンコーダの隠れ状態 None 49. GoogLeNetにおいて「1x1畳み込み」の役割は何ですか? 特徴マップのサイズを縮小するため モデルの計算量を減少させるため 次元削減を行い、計算効率を向上させるため モデルのパラメータ数を増加させるため None 50. DenseNetが他の深層学習モデルに比べて「メモリ効率が高い」と言われる理由は何ですか? モデルのパラメータ数が少ないため トランジションレイヤーが全ての層に適用されているため 特徴マップのサイズを一定に保っているため 各層が特徴マップを再利用し、不要な計算を減らしているため None Time's up