DS検定~模擬試験④~ 2024年12月7日 ailearn 1. 分析評価において、「リコール(再現率)」が高いことが重要とされる場面は次のうちどれですか? クレジットカードのスコアリング 商品のおすすめエンジン 広告のクリック予測 健康診断でのがん検出 None 2. データの欠損値(Missing Data)に対して、一般的に使用される処理方法として正しいものはどれですか? 平均値や中央値で補完する データ全体を削除する データを逆順に並び替える データをランダムに入れ替える None 3. データが不均衡である場合にモデル評価の指標として推奨されるのは次のうちどれですか? 精度 AUC-ROC 平均二乗誤差 F1スコア None 4. 以下のPythonコードを使用して、「欠損値の補完」を実行する際に、fillna() の引数として適切な値を指定することで、各列の平均値で補完するコードとして正しいものは次のうちどれですか? import pandas as pddata = {'col1': [1, None, 3], 'col2': [4, 5, None]}df = pd.DataFrame(data)# 欠損値補完df_filled = df.fillna(_____) 0 df.median() df.mean() method='bfill' None 5. 次のうち、データを説明する際に「ピボットテーブル」を使う主な利点は何ですか? データを無作為に並び替えることができる データの正確性を低下させる データの可視化を自動的に行う データを簡単に集計し、視覚的に示すことができる None 6. 特徴量選択の手法として「逐次後退選択法(Backward Elimination)」を使用する利点は次のうちどれですか? 全ての特徴量を保持しながらモデルの精度を最大化できる 最も重要でない特徴量を順次削除し、最適な特徴量セットを見つけることができる 特徴量の数を増やすことでモデルの過学習を防ぐことができる カテゴリカルデータを自動的に数値に変換できる None 7. 回帰分析における「多重共線性」が問題となる理由として正しいものは次のうちどれですか? 特徴量間の独立性が高くなるため。 モデルが過学習しやすくなるため。 回帰係数の推定値が不安定になるため。 クロスバリデーションの結果が無効になるため。 None 8. 時系列データのモデル化において、「自己回帰(AR)」モデルが前提とする条件として正しいものは次のうちどれですか? データが定常過程であること。 データが一定の周期性を持つこと。 データが単調増加または単調減少すること。 データが高次元であること。 None 9. 時系列データの予測結果を説明する際に、データのトレンドや季節性を強調するために最も適したグラフは次のうちどれですか? 折れ線グラフ 散布図 棒グラフ 円グラフ None 10. データ分析プロジェクトで「ベイズ最適化」を使用する主な理由として最も適切なものは次のうちどれですか? モデルのハイパーパラメータ探索を効率化するため すべてのパラメータを手動で調整するため モデルの計算速度を低下させるため 無作為にパラメータを設定するため None 11. モデルの利活用において、バイアスとバリアンスのトレードオフはどのように関連していますか? バイアスが高いほど、モデルの複雑さが増す バリアンスが高いほど、モデルは過学習しやすくなる バリアンスが低いほど、モデルは過学習しやすくなる バイアスが高いほど、モデルの精度が上がる None 12. データの正規性を説明するために最もよく使用されるグラフは次のうちどれですか? 散布図 Q-Qプロット 棒グラフ 円グラフ None 13. クロスバリデーションの主な目的は何ですか? モデルの性能を評価し、過学習を防ぐこと モデルのパラメータ数を減らすこと モデルの複雑さを増やすこと モデルの学習速度を速めること None 14. 勾配ブースティングのアンサンブル学習において、弱学習器とはどのような役割を果たしますか? 単一の高精度なモデルを作る データセット全体に対して1つのモデルを訓練する 各学習器が前の学習器の誤差を補正する 各学習器が独立して予測を行う None 15. データ加工で、「IQR(四分位範囲)」を用いて外れ値を検出する際の計算手順として正しいものは次のうちどれですか? データの平均値と標準偏差を求め、2倍の標準偏差を超えるデータを外れ値とみなす。 第1四分位数(Q1)と第3四分位数(Q3)を計算し、IQRの1.5倍範囲を超えるデータを外れ値とみなす。 データを正規化した後、0~1の範囲に収まらないデータを外れ値とみなす。 クラスタリングを実施し、どのクラスタにも属さないデータを外れ値とみなす。 None 16. データ共有における「Data Lake」と「Data Warehouse」の主な違いは次のうちどれですか? Data Lakeはデータをリアルタイムで処理し、Data Warehouseはバッチ処理を行う Data Lakeは非構造化データを扱い、Data Warehouseは構造化データを扱う Data Lakeは小規模なデータを対象とし、Data Warehouseは大規模なデータを対象とする Data Lakeはトランザクションをサポートし、Data Warehouseはサポートしない None 17. モデル構築において、特徴量の「スケーリング」が必要となる理由は次のうちどれですか? モデルの学習速度を向上させるため。 特徴量間の相関を完全に排除するため。 すべてのモデルで絶対に必要な手順だから。 特徴量の単位やスケールが異なる場合に影響を均一化するため。 None 18. モデルの利活用において、データが定期的に追加されるシナリオで推奨される手法はどれですか? モデルの完全な再トレーニング 増分学習 モデルのパラメータ調整のみ データの削除 None 19. データの不均衡を解消するために、「オーバーサンプリング」を行う利点は次のうちどれですか? 少数クラスのデータを増やすことで、クラスのバランスを保つことができる データの精度を向上させるため データセット全体のサイズを減少させるため カテゴリデータを自動的に数値に変換できるため None 20. ヒストグラムの役割として正しいものは次のうちどれですか? データの平均値を求めるため データの散らばり具合を視覚的に示すため データの因果関係を示すため データの時系列変化を示すため None 21. モデルのパフォーマンスを評価するためにROC曲線を使用する主な目的は何ですか? モデルの予測値を確認するため モデルの複雑さを測定するため モデルがどのようにクラスを区別するかを評価するため モデルの正確な予測確率を示すため None 22. モデルにおける「バイアス-バリアンストレードオフ」とは何を指しますか? モデルのバイアスとバリアンスのバランスを取ること モデルの計算速度と精度のバランスを取ること データのサイズとモデルの複雑さを調整すること データの分散を減らすための手法 None 23. モデルの解釈性を向上させるために「SHAP」を利用する際、どのような情報が得られますか? 各予測に対する特徴量の貢献度。 モデルの全体的な構造と重み。 データセットの欠損値の補完方法。 モデルのハイパーパラメータ最適化手順。 None 24. データ共有の際に、「データの非対称暗号化」が採用される理由は次のうちどれですか? 全てのユーザーが同じ鍵を使用して、データを暗号化できるため データの送信者と受信者が異なる鍵を使用して、データの安全性を高めるため データのサイズを圧縮するため データのリアルタイム性を保証するため None 25. データ加工において、「データの正規化(Normalization)」と「標準化(Standardization)」の主な違いとして正しいものは次のうちどれですか? 正規化はデータの平均を0にするが、標準化はしない。 正規化は欠損値を補完する手法で、標準化は特徴量のエンコーディングに使用される。 正規化は外れ値を削除するが、標準化は外れ値を無視する。 正規化はデータを0~1の範囲にスケーリングするが、標準化は分散を1にスケーリングする。 None 26. データ加工において、「ワンホットエンコーディング」を適用した場合のデータの特徴として正しいものは次のうちどれですか? カテゴリ変数を1つの数値で表現する。 カテゴリ変数ごとに個別の二値変数を作成する。 カテゴリ変数を平均値で補完する。 カテゴリ変数を時系列データに変換する。 None 27. 分析評価において「A/Bテスト」を実施する際、最も重要な前提条件は次のうちどれですか? 対象群と実験群がランダムに分割されていること 全てのユーザーが同じテストに参加すること 実験終了後に全てのデータを削除すること テストの結果を公開しないこと None 28. あるデータセットにおいて、平均値が中央値よりも大きい場合、データの分布に関して最も適切な説明は次のうちどれですか? データは正規分布している データは左に歪んでいる(左偏) データは右に歪んでいる(右偏) データは一様分布している None 29. データの異常値(外れ値)を検出するために用いられる「箱ひげ図」の主な利点は次のうちどれですか? 平均値を明確に表示する データの相関を示す 時系列データを示す 外れ値を視覚的に確認できる None 30. モデルの利活用において、予測精度の評価に使われる指標の一つはどれですか? 平均二乗誤差 (MSE) パラメータ数 サンプル数 分散 None 31. モデル評価において、「混同行列」が提供する情報は次のうちどれですか? モデルの正確性、誤分類の内訳 モデルの学習曲線の進行状況 データセットの重複率 モデルのトレーニング時間 None 32. データ分析において「外れ値」の影響を軽減するための一般的な手法として最も適切なものは次のうちどれですか? ロバストな統計手法(例えば、中央値や四分位範囲)を使用する 外れ値を無視する 外れ値を平均値で補完する 外れ値をそのまま残す None 33. 「ファイル共有サービス」で一般的に使用されるプロトコルは次のうちどれですか? SMTP FTP IMAP HTTP/2 None 34. データ共有において、「アクセストークン」が使用される主な理由は次のうちどれですか? データ共有を暗号化するため。 データ共有のトラフィックを最適化するため。 データへのアクセス権限を一時的に付与するため。 データ共有の速度を向上させるため。 None 35. 主成分分析(PCA)による次元削減の利点は次のうちどれですか? データの欠損値を補完できる 特徴量のスケールを揃えることができる データの分散を最大化しながら次元数を削減できる 非線形関係を取り入れることができる None 36. データ加工における「ラグ特徴量(Lag Features)」とは、次のうちどれを意味しますか? 過去のデータを基に生成される新しい特徴量 特定の特徴量の欠損を補完するための手法 カテゴリデータを数値に変換するための手法 時系列データをリアルタイムで処理するためのアルゴリズム None 37. 本番環境で使用されているモデルが突然精度低下を起こした場合、考えられる原因として最も適切なものは次のうちどれですか? モデルのハイパーパラメータが変更された。 トレーニングデータが削除された。 モデルのアルゴリズムが過学習を起こした。 データドリフトが発生した。 None 38. 「ヒートマップ」は次のうちどの目的で使用されますか? データの相関関係を視覚的に示すため データの平均値を計算するため データの標準偏差を表示するため データを並び替えるため None 39. 「データガバナンス」における主な目的は次のうちどれですか? データの圧縮を最適化し、保存容量を減らすこと データベースのクエリを最適化すること データの品質、整合性、安全性を確保し、適切に管理すること データのリアルタイム共有を実現すること None 40. モデルの公平性を確保するために行うべきアプローチとして最も適切なものは次のうちどれですか? 学習データセットに存在するバイアスを削除または調整する。 学習データセットをランダムに選択して再トレーニングする。 モデルの精度が最大化するようにハイパーパラメータを調整する。 モデルの予測を一部修正する手動プロセスを追加する。 None 41. Lasso回帰におけるL1正則化の主な効果はどれですか? モデルの重みを全て大きくする モデルの重みを小さくして、特定の特徴量をゼロにする 特徴量の相関を強化する モデルの学習速度を遅くする None 42. 時系列データの分割において、「スライディングウィンドウ法」を使用する主な目的は次のうちどれですか? データをランダムにシャッフルして分割する データの時間的な依存性を考慮して、連続したデータを扱うことができる データセット全体のサイズを削減する 時系列データを静的なデータに変換する None 43. データの「異常値」を説明する際に使用する適切な手法は次のうちどれですか? 平均値を強調する 外れ値を無視する 箱ひげ図を使って外れ値を視覚的に示す 外れ値を削除して説明する None 44. ランダムフォレストはどのようにして過学習を防いでいますか? 少数の決定木を使用して、全てのデータを学習する 訓練データをシャッフルして多数の決定木を作成し、その平均を取る 1つの決定木を大きく成長させることで、データの特徴を完全に学習する 訓練データを正則化して、過学習を防ぐ None 45. 次のうち、「多重共線性」が回帰分析の結果に与える影響として最も適切な説明はどれですか? 説明変数間に強い相関がある場合、回帰係数の解釈が不安定になる データの分布が正規分布でなくなる データの欠損値が増加する 外れ値の影響が強くなる None 46. 決定木モデルにおいて、各ノードに分岐する際の基準としてよく使われる指標はどれですか? 標準偏差 相関係数 ジニ係数 決定係数 None 47. データ加工で、カテゴリ変数を数値データに変換する手法として正しいものはどれですか? 正規化 ワンホットエンコーディング 標準化 フィルタリング None 48. モデルの汎化性能を評価するために行う手法の一つはどれですか? 正則化 モデルの再トレーニング クロスバリデーション モデルの複雑化 None 49. データを説明する際に「ヒートマップ」を使用する主な目的は次のうちどれですか? 時系列データの変化を示す 2次元データのパターンや相関を視覚化する カテゴリデータの分布を示す 外れ値を特定する None 50. 「モデルのバイアス-バリアンストレードオフ」が示す課題は次のうちどれですか? 高精度なモデルを作るほどコストが増加する モデルがシンプルすぎると過学習が発生する モデルが複雑すぎると過学習が発生し、シンプルすぎると学習不足になる モデルが一度構築されると修正できない None 51. データ分析でよく使用される「分散分析(ANOVA)」の目的は何ですか? 単一のグループの中央値を求める 2つの変数間の相関を確認する データの時系列分析を行う 複数のグループの平均値の差が有意かどうかを確認する None 52. 「主成分分析(PCA)」の主な目的は次のうちどれですか? データの平均値を求める データの相関関係を調べる データの欠損値を補完する データの次元を削減し、主要な特徴を抽出する None 53. クロス集計表を用いる主な目的は次のうちどれですか? 1つの変数の分布を見る 2つ以上のカテゴリ変数の関係性を把握する データの相関関係を確認する データの標準偏差を計算する None 54. モデルを運用環境にデプロイする際に考慮すべき「レイテンシー」とは何ですか? モデルの予測精度 モデルの再トレーニングにかかる時間 モデルの応答速度 モデルの学習に必要なデータ量 None 55. データサイエンスにおいて、モデルを活用する際に最も重要なステップの一つは何ですか? モデルのトレーニング モデルのパラメータチューニング モデルのデプロイ モデルのハイパーパラメータ設定 None 56. モデルのフェアネス(公平性)を評価する際に使用される指標として適切なものは次のうちどれですか? 混同行列 クロスエントロピー デメトリックパリティ(Demographic Parity) 平均二乗誤差(MSE) None 57. あるデータセットの2つの変数間の関係を可視化するために最も適切なグラフは次のうちどれですか? ヒストグラム 散布図 箱ひげ図 円グラフ None 58. 比較を行う際に使用するべきグラフとして最も適切なものは次のうちどれですか? 円グラフ 散布図 棒グラフ ヒストグラム None 59. データ加工において、データを正規化する主な目的は何ですか? データの冗長性を減らし、整合性を保つこと データの計算速度を上げること データを暗号化すること データのサイズを圧縮すること None 60. データの季節性やトレンドを把握するために、時系列データを平滑化する手法として最も適切なものは次のうちどれですか? 単回帰分析 移動平均 ロジスティック回帰 相関分析 None 61. データ共有における「分散トレーシング」の目的として最も適切なものは次のうちどれですか? データ共有時の遅延や障害箇所を特定するため。 データ共有プロトコルを統一するため。 データの完全性を保証するため。 データの暗号化を効率化するため。 None 62. 時系列データにおける「移動平均(Moving Average)」の主な目的は次のうちどれですか? データの欠損値を補完する データの分布を正規化する データのノイズを除去し、トレンドを明確にする データをランダムにシャッフルする None 63. サポートベクターマシン (SVM) では、カーネル関数を使用する主な理由は何ですか? 非線形なデータを高次元空間に写像し、線形分離可能にするため 訓練データを効率的に処理するため データのスケーリングを容易にするため 過学習を防ぐため None 64. 分析評価における「ヒストリカルバイアス」を排除するために有効な手法は次のうちどれですか? データ収集期間を見直し、最新のデータを優先する モデルのパラメータを変更する バイアスが含まれたデータをそのまま使用する データの分散を高める None 65. データの正規性を確認するために使用される統計手法として最も適切なものは次のうちどれですか? カイ二乗検定 ピアソンの相関係数 シャピロ・ウィルク検定 クラスタリング None 66. データ分析の評価指標として「R²(決定係数)」が示すものは次のうちどれですか? モデルの精度が100%に近いこと モデルがデータの変動をどれだけ説明できるか モデルがデータに過適合している割合 モデルのエラーを最小化するための方法 None 67. クロスバリデーションの目的は次のうちどれですか? モデルの精度を最大化するために、データセット全体を使用する モデルの処理速度を向上させるため モデルの汎化性能を評価するために、異なるデータセットでモデルを検証する データの前処理を自動化するため None 68. モデルの「正則化(regularization)」とは何を指しますか? モデルの複雑さを増やして、精度を向上させる手法 モデルのパラメータを制約することで、過学習を防ぐ手法 モデルの学習速度を速める手法 データの分布を正規化する手法 None 69. 大規模なデータセットに対して、データのメモリ使用量を削減し、効率的に処理するための一般的な手法は次のうちどれですか? データをシャッフルする データをソートする データの型を最適化する データを削除する None 70. データの代表値の一つである「中央値」はどのようなデータの特徴を表しますか? データの最頻値 データの平均値 データを大小順に並べたとき、中央に位置する値 データの最大値と最小値の差 None 71. 線形回帰モデルにおける「重み」とは何を指しますか? 変数間の相関の強さ 説明変数に対する従属変数の影響度 変数の相対的な順序 データの分散の指標 None 72. 時系列データの傾向を説明する際、移動平均を用いる主な目的は次のうちどれですか? 外れ値を完全に削除する データの変動を平滑化し、トレンドを明確にする 時系列データを一括で解析する データを異なるカテゴリに分割する None 73. 分析結果の評価において最も重要な要素は次のうちどれですか? 結果が直感的にわかりやすいこと 分析が効率的に行われたかどうか 分析結果がビジネスの目的に一致していること 分析に使用したツールが最新であること None 74. データの共有において、データの完全性と機密性を保つために使用される技術は次のうちどれですか? 圧縮 暗号化 トークン化 フィルタリング None 75. 分析評価のプロセスで「AUC(ROC曲線下の面積)」を使用する理由は次のうちどれですか? モデルの処理速度を測定するため データセットのサイズを確認するため モデルの再現率を最適化するため モデルが様々な閾値でどの程度正確に分類できるかを測定するため None 76. モデルのパフォーマンスを向上させるために、次元削減が必要な場合に使用される手法はどれですか? ランダムフォレスト PCA(主成分分析) ロジスティック回帰 k-近傍法 None 77. データを扱う際に重要な「分位点」とは何を意味しますか? データを特定の割合で区分した点 データの平均値 データの最大値と最小値の平均 データの標準偏差 None 78. 相関係数が正の値を示す場合、次のうちどの関係性があると考えられますか? 2つの変数が同じ方向に動く 2つの変数が逆方向に動く 2つの変数が無関係である 2つの変数が完全に独立している None 79. 効果的なデータの説明における「データの可視化」の目的として正しいものは次のうちどれですか? データを視覚的にわかりやすく伝える データを簡単に削除するため データを正確に分析するため データを隠すため None 80. データ共有における「データカタログ」の主な機能は次のうちどれですか? データを暗号化し、セキュリティを強化する データの処理速度を最適化する データベースのスケーリングを行う データの内容や構造に関する情報を集約し、ユーザーが適切なデータを発見できるようにする None 81. モデル評価において「損失関数」の役割は次のうちどれですか? モデルが予測した値と実際の値の誤差を数値化するため モデルの正答率を評価するため モデルの実行速度を計測するため モデルのパラメータを最適化するため None 82. 予測モデルを本番環境にデプロイする際、APIの利用が推奨される理由は何ですか? モデルのスケーラビリティを向上させるため モデルの再学習が不要になるため モデルのパフォーマンスが向上するため モデルのパラメータを固定するため None 83. 正規化の手法の一つである「最小-最大スケーリング(Min-Max Scaling)」の目的は何ですか? データの平均を0にする データの分布を正規分布に近づける データを指定した範囲にスケーリングする データを標準偏差1にする None 84. モデルのデプロイ後に予測結果をリアルタイムで提供する際、必要とされる機能として最も適切なものは次のうちどれですか? バッチ処理機能 REST APIまたはgRPCの提供 モデルの再トレーニング機能 データ可視化ダッシュボード None 85. 分析評価における「F1スコア」とは何を表していますか? モデルの計算速度 データセットのサイズとモデルの適合性 モデルの訓練時間 精度と再現率の調和平均 None 86. データを説明する際、対象者の理解を促進するために考慮すべき要素は次のうちどれですか? 対象者のバックグラウンドや専門知識レベル データの量 グラフの色彩 文字の大きさ None 87. ロジスティック回帰モデルは、どのようなタイプのデータに対して使用されますか? 連続値データの予測 二値分類問題 多値分類問題 非線形データの予測 None 88. データ共有において、データの「キャッシュ」を利用する主な目的は次のうちどれですか? データの圧縮を行い、保存スペースを節約するため データのアクセス権を管理するため データの暗号化強度を高めるため 頻繁にアクセスされるデータの応答時間を短縮するため None 89. データを説明する際、適切なグラフの軸設定に関する最も重要な注意点は次のうちどれですか? グラフの軸を省略することで見た目を簡潔にする 必ず軸の範囲を0から開始する データの特徴に応じて軸の範囲を適切に設定する 軸の範囲を最大値以上に設定する None 90. 精度と再現率を評価する際、精度とはどのような指標を示していますか? 予測が正しい割合 モデルが外れ値を除外する能力 予測モデルの処理速度 モデルが予測しなかったデータの比率 None 91. データ共有において、「メタデータ」の役割として正しいものはどれですか? データの内容や構造に関する情報を提供する データを暗号化する データの圧縮アルゴリズムを指定する データをリアルタイムで同期する None 92. ビッグデータ解析において、非常に大量のデータから有用な情報を抽出するための技術として最も適切なものは次のうちどれですか? データサンプリング データマイニング データ可視化 データフィルタリング None 93. モデルの「ブラックボックス」問題とは何ですか? モデルの予測結果が解釈できないこと モデルがすべてのデータをランダムに処理すること モデルのパラメータが固定されていること モデルが正確な予測を常に行うこと None 94. 分析評価で「ヒストリカルバイアス」を検出する最適な方法として最も適切なものは次のうちどれですか? データセットを無作為に分割して評価する モデルの出力だけを比較する 全てのデータを削除して再収集する データ収集時点での条件を再確認する None 95. データのトレンドを説明する際、折れ線グラフを使用したが、季節性が不明確な場合に最も適切な対応は次のうちどれですか? データポイントを増やす 移動平均線を追加してトレンドを明確化する 折れ線グラフを棒グラフに変更する グラフの色を変えることで視覚的にわかりやすくする None 96. データ共有の際に「分散ファイルシステム」を利用する利点は次のうちどれですか? データを圧縮して保存できる データをリアルタイムで共有できる データの完全性を保証できる 大規模データを複数のサーバーに分散して保存することで、処理速度を向上させることができる None 97. 欠損データが発生している場合、欠損の発生パターンに応じて適切な処理方法を選択することが重要ですが、データが「完全にランダムに欠損している」場合に適切な処理方法はどれですか? データを無作為に削除する 欠損部分を平均値で補完する 欠損部分を推測して補完する 欠損部分をそのまま残す None 98. 相関関係を持つ2つの変数間の因果関係を説明する際に避けるべきことは次のうちどれですか? 相関関係を強調する グラフを使用して視覚的に説明する 相関係数を用いる 因果関係がない場合も因果関係があると主張する None 99. 欠損値が多く存在するデータに対して、モデル化を行う前に推奨される処理方法は次のどれですか? 欠損値の削除 多重代入法 平均補完 ラベルエンコーディング None 100. 時系列データの分析において、データの「自己相関」を確認する理由として最も適切なものは次のうちどれですか? データ間に因果関係があるかどうかを確認するため データが一定の間隔で繰り返すパターンを持つかどうかを確認するため データがすべて独立しているかを確認するため データの平均値を計算するため None Time's up