DS検定~模擬試験④~ 2024年12月7日 ailearn 1. 多クラス分類問題における評価指標として適切なものは次のどれですか? 精度 平均二乗誤差(MSE) 決定係数 マクロ平均F1スコア None 2. モデルの「正則化(regularization)」とは何を指しますか? モデルの複雑さを増やして、精度を向上させる手法 モデルのパラメータを制約することで、過学習を防ぐ手法 モデルの学習速度を速める手法 データの分布を正規化する手法 None 3. モデルのフェアネス(公平性)を担保するために使用される評価手法はどれですか? AUC-ROC バイアス検出ツール クロスバリデーション 精度評価 None 4. データを説明する際、対象者の理解を促進するために考慮すべき要素は次のうちどれですか? 対象者のバックグラウンドや専門知識レベル データの量 グラフの色彩 文字の大きさ None 5. モデルのフェアネス(公平性)を評価する際に使用される指標として適切なものは次のうちどれですか? 混同行列 クロスエントロピー デメトリックパリティ(Demographic Parity) 平均二乗誤差(MSE) None 6. データ共有において、「メタデータ」の役割として正しいものはどれですか? データの内容や構造に関する情報を提供する データを暗号化する データの圧縮アルゴリズムを指定する データをリアルタイムで同期する None 7. 分析評価で使用される「A/Bテスト」の主な目的は次のうちどれですか? 2つの異なる手法やアプローチを比較し、どちらが効果的かを判断するため モデルの訓練データを増やすため データセットを分割してモデルを評価するため データの精度を向上させるため None 8. 分析評価において、「リコール(再現率)」が高いことが重要とされる場面は次のうちどれですか? クレジットカードのスコアリング 商品のおすすめエンジン 広告のクリック予測 健康診断でのがん検出 None 9. データ加工において、「外れ値」を検出するための統計手法として一般的に使用されるものは次のうちどれですか? 標準偏差 主成分分析(PCA) K-平均クラスタリング 平均二乗誤差(MSE) None 10. Lasso回帰におけるL1正則化の主な効果はどれですか? モデルの重みを全て大きくする モデルの重みを小さくして、特定の特徴量をゼロにする 特徴量の相関を強化する モデルの学習速度を遅くする None 11. データ加工における「ラグ特徴量(Lag Features)」とは、次のうちどれを意味しますか? 過去のデータを基に生成される新しい特徴量 特定の特徴量の欠損を補完するための手法 カテゴリデータを数値に変換するための手法 時系列データをリアルタイムで処理するためのアルゴリズム None 12. データ共有プロセスにおいて、「データ所有権」の管理が重要な理由は次のうちどれですか? データの使用範囲や責任範囲を明確にすることで、法的リスクを回避するため データの圧縮率を向上させるため データの形式を変換するため データを暗号化して転送するため None 13. 「ヒートマップ」は次のうちどの目的で使用されますか? データの相関関係を視覚的に示すため データの平均値を計算するため データの標準偏差を表示するため データを並び替えるため None 14. データのトレンドを説明する際、折れ線グラフを使用したが、季節性が不明確な場合に最も適切な対応は次のうちどれですか? データポイントを増やす 移動平均線を追加してトレンドを明確化する 折れ線グラフを棒グラフに変更する グラフの色を変えることで視覚的にわかりやすくする None 15. データの相関関係を説明する際、散布図を使用した結果、明確な相関が見られない場合に考慮すべき最も適切な対応は次のうちどれですか? データの他の変数を確認し、新たな相関を探す 相関がないと結論付けて分析を終了する 相関関係を人工的に作るためにデータを加工する 散布図を折れ線グラフに変更する None 16. モデルの評価指標として、精度(accuracy)以外にモデルの性能を評価するために適切な指標はどれですか? AUC-ROC 平均二乗誤差(MSE) p値 偏差 None 17. 「データ共有プラットフォーム」のスケーラビリティを向上させるために一般的に使用される手法は次のうちどれですか? クラウドストレージのキャッシュ 圧縮アルゴリズムの変更 マイクロサービスアーキテクチャ データのファイル形式を変更する None 18. モデルの定期的なメンテナンスが重要である理由として最も適切なのは次のうちどれですか? モデルのパフォーマンスが時間とともに低下する可能性があるため モデルの複雑さを常に増やすため モデルのハイパーパラメータを維持するため モデルがバイアスを持つことを防ぐため None 19. データの代表値の一つである「中央値」はどのようなデータの特徴を表しますか? データの最頻値 データの平均値 データを大小順に並べたとき、中央に位置する値 データの最大値と最小値の差 None 20. カテゴリ変数を数値に変換する際に、頻度ベースのエンコーディング手法を使用する利点は次のうちどれですか? 全てのカテゴリを独立したバイナリ変数に変換できる 変換後のデータがモデルに対して高い予測力を持つ可能性がある カテゴリ数が多くてもメモリ効率が良くなる カテゴリ変数を削除してデータセットを縮小できる None 21. データ分析の評価指標として「R²(決定係数)」が示すものは次のうちどれですか? モデルの精度が100%に近いこと モデルがデータの変動をどれだけ説明できるか モデルがデータに過適合している割合 モデルのエラーを最小化するための方法 None 22. 予測モデルを本番環境にデプロイする際、APIの利用が推奨される理由は何ですか? モデルのスケーラビリティを向上させるため モデルの再学習が不要になるため モデルのパフォーマンスが向上するため モデルのパラメータを固定するため None 23. 以下のPythonコードを使用して、「欠損値の補完」を実行する際に、fillna() の引数として適切な値を指定することで、各列の平均値で補完するコードとして正しいものは次のうちどれですか? import pandas as pddata = {'col1': [1, None, 3], 'col2': [4, 5, None]}df = pd.DataFrame(data)# 欠損値補完df_filled = df.fillna(_____) 0 df.median() df.mean() method='bfill' None 24. 時系列データの傾向を説明する際、移動平均を用いる主な目的は次のうちどれですか? 外れ値を完全に削除する データの変動を平滑化し、トレンドを明確にする 時系列データを一括で解析する データを異なるカテゴリに分割する None 25. 欠損データが発生している場合、欠損の発生パターンに応じて適切な処理方法を選択することが重要ですが、データが「完全にランダムに欠損している」場合に適切な処理方法はどれですか? データを無作為に削除する 欠損部分を平均値で補完する 欠損部分を推測して補完する 欠損部分をそのまま残す None 26. データサイエンスにおいて、モデルを活用する際に最も重要なステップの一つは何ですか? モデルのトレーニング モデルのパラメータチューニング モデルのデプロイ モデルのハイパーパラメータ設定 None 27. モデルのパフォーマンスを向上させるために、次元削減が必要な場合に使用される手法はどれですか? ランダムフォレスト PCA(主成分分析) ロジスティック回帰 k-近傍法 None 28. モデルの解釈性を向上させるために「SHAP」を利用する際、どのような情報が得られますか? 各予測に対する特徴量の貢献度。 モデルの全体的な構造と重み。 データセットの欠損値の補完方法。 モデルのハイパーパラメータ最適化手順。 None 29. 効果的なデータの説明における「データの可視化」の目的として正しいものは次のうちどれですか? データを視覚的にわかりやすく伝える データを簡単に削除するため データを正確に分析するため データを隠すため None 30. データ加工において、非線形な特徴量をモデルに取り入れるために一般的に使用される手法は次のうちどれですか? Zスコアを計算する ワンホットエンコーディングを行う 多項式特徴量(Polynomial Features)を作成する 正規化を行う None 31. アンサンブル学習の手法として、「ブースティング」と「バギング」の主な違いは次のうちどれですか? ブースティングは並列処理、バギングは逐次処理を行う。 ブースティングは弱学習器を直列的に学習させ、バギングは並列的に学習させる。 バギングはモデルのバイアスを低減し、ブースティングは分散を低減する。 ブースティングはランダム性を導入し、バギングは強いモデルを用いる。 None 32. データ分析において「外れ値」の影響を軽減するための一般的な手法として最も適切なものは次のうちどれですか? ロバストな統計手法(例えば、中央値や四分位範囲)を使用する 外れ値を無視する 外れ値を平均値で補完する 外れ値をそのまま残す None 33. 分析評価における「ヒストリカルバイアス」を排除するために有効な手法は次のうちどれですか? データ収集期間を見直し、最新のデータを優先する モデルのパラメータを変更する バイアスが含まれたデータをそのまま使用する データの分散を高める None 34. データ共有において、データの「キャッシュ」を利用する主な目的は次のうちどれですか? データの圧縮を行い、保存スペースを節約するため データのアクセス権を管理するため データの暗号化強度を高めるため 頻繁にアクセスされるデータの応答時間を短縮するため None 35. 「ピボットテーブル」を使うときの主な利点は次のうちどれですか? 大量のデータを効率的に集計・分析することができる データを削除することができる データを無作為に並び替えることができる データを視覚的に表示することができる None 36. データ共有の際に、「データの非対称暗号化」が採用される理由は次のうちどれですか? 全てのユーザーが同じ鍵を使用して、データを暗号化できるため データの送信者と受信者が異なる鍵を使用して、データの安全性を高めるため データのサイズを圧縮するため データのリアルタイム性を保証するため None 37. データ加工において、「ワンホットエンコーディング」を適用した場合のデータの特徴として正しいものは次のうちどれですか? カテゴリ変数を1つの数値で表現する。 カテゴリ変数ごとに個別の二値変数を作成する。 カテゴリ変数を平均値で補完する。 カテゴリ変数を時系列データに変換する。 None 38. 外れ値の検出と除去において、IQR(四分位範囲)を使用する理由は次のうちどれですか? データの標準偏差が不明な場合でも使用できるため 外れ値を自動的に補完できるため データの分布が正規分布である場合に限って適用できるため データの分布に関係なく、安定した外れ値の検出ができるため None 39. データの散らばり具合を示す指標である「標準偏差」は、次のうちどのような意味を持ちますか? データの平均値 データの中央値 データが平均からどれだけ離れているかを示す データの最大値と最小値の差 None 40. 分析評価において、適合率(precision)を向上させるためには、次のどの要素に焦点を当てるべきですか? モデルが誤って予測する「偽陽性」を減らす モデルの計算速度を向上させる データセットを小さくする モデルの訓練時間を短縮する None 41. モデルのパフォーマンスを評価するためにROC曲線を使用する主な目的は何ですか? モデルの予測値を確認するため モデルの複雑さを測定するため モデルがどのようにクラスを区別するかを評価するため モデルの正確な予測確率を示すため None 42. モデル評価において、「混同行列」が提供する情報は次のうちどれですか? モデルの正確性、誤分類の内訳 モデルの学習曲線の進行状況 データセットの重複率 モデルのトレーニング時間 None 43. データ共有プラットフォームで「マルチテナントアーキテクチャ」が使用される理由は次のうちどれですか? 複数のユーザーが同一のシステムを共有しながらも、データを分離して管理できるため データの暗号化を自動的に行うため データの圧縮を効率化するため データベースのクエリを高速化するため None 44. 分析評価における「F1スコア」とは何を表していますか? モデルの計算速度 データセットのサイズとモデルの適合性 モデルの訓練時間 精度と再現率の調和平均 None 45. 分析評価のプロセスで「AUC(ROC曲線下の面積)」を使用する理由は次のうちどれですか? モデルの処理速度を測定するため データセットのサイズを確認するため モデルの再現率を最適化するため モデルが様々な閾値でどの程度正確に分類できるかを測定するため None 46. データ共有における「データ共有契約」の主な目的は次のうちどれですか? データの利用条件と責任範囲を明確にする データのファイル形式を定義する データベースのパフォーマンスを向上させる データのバックアップを行う None 47. 欠損値が多く存在するデータに対して、モデル化を行う前に推奨される処理方法は次のどれですか? 欠損値の削除 多重代入法 平均補完 ラベルエンコーディング None 48. 分析評価において、モデルの「過適合(オーバーフィッティング)」を軽減するために効果的な手法は次のうちどれですか? ドロップアウトやL2正則化を導入する モデルの複雑さを増やす 訓練データを削減する 精度を向上させるためにすべてのデータを使用する None 49. データ加工において、データを正規化する主な目的は何ですか? データの冗長性を減らし、整合性を保つこと データの計算速度を上げること データを暗号化すること データのサイズを圧縮すること None 50. クロス集計表を用いる主な目的は次のうちどれですか? 1つの変数の分布を見る 2つ以上のカテゴリ変数の関係性を把握する データの相関関係を確認する データの標準偏差を計算する None 51. 分析評価で「ヒストリカルバイアス」を検出する最適な方法として最も適切なものは次のうちどれですか? データセットを無作為に分割して評価する モデルの出力だけを比較する 全てのデータを削除して再収集する データ収集時点での条件を再確認する None 52. モデルにおける「バイアス-バリアンストレードオフ」とは何を指しますか? モデルのバイアスとバリアンスのバランスを取ること モデルの計算速度と精度のバランスを取ること データのサイズとモデルの複雑さを調整すること データの分散を減らすための手法 None 53. サポートベクターマシン (SVM) では、カーネル関数を使用する主な理由は何ですか? 非線形なデータを高次元空間に写像し、線形分離可能にするため 訓練データを効率的に処理するため データのスケーリングを容易にするため 過学習を防ぐため None 54. データの季節性やトレンドを把握するために、時系列データを平滑化する手法として最も適切なものは次のうちどれですか? 単回帰分析 移動平均 ロジスティック回帰 相関分析 None 55. データを「説明する」ときに最も重要なポイントの1つは次のうちどれですか? データを使わず、主観的な意見を述べる データを細かく説明せずに要約を省く データの出典を示さない 結論に基づいた根拠をデータとして示す None 56. 次のうち、「ロジスティック回帰分析」を使用する際に最も適切な場合はどれですか? 目的変数がカテゴリカルデータの場合 目的変数が連続値の場合 データが時系列データの場合 データが相関していない場合 None 57. データ共有における「API」の役割として正しいものはどれですか? 異なるシステム間でデータをやり取りするためのインターフェース データを圧縮して送信する技術 データを暗号化して送信する技術 データの可視化を行う技術 None 58. 「データガバナンス」における主な目的は次のうちどれですか? データの圧縮を最適化し、保存容量を減らすこと データベースのクエリを最適化すること データの品質、整合性、安全性を確保し、適切に管理すること データのリアルタイム共有を実現すること None 59. モデルを本番環境にデプロイする際に、クラウドプラットフォームを利用する主な利点として最も適切なものは次のうちどれですか? モデルの再トレーニングが不要になる。 スケーラビリティと可用性が向上する。 モデルの精度が自動的に向上する。 モデルのバイアスが自動的に修正される。 None 60. 相関関係を持つ2つの変数間の因果関係を説明する際に避けるべきことは次のうちどれですか? 相関関係を強調する グラフを使用して視覚的に説明する 相関係数を用いる 因果関係がない場合も因果関係があると主張する None 61. データ分析プロジェクトで「ベイズ最適化」を使用する主な理由として最も適切なものは次のうちどれですか? モデルのハイパーパラメータ探索を効率化するため すべてのパラメータを手動で調整するため モデルの計算速度を低下させるため 無作為にパラメータを設定するため None 62. 複数の要因が結果にどのように影響しているかを説明する際、最も適切な分析手法は次のうちどれですか? 単回帰分析 分散分析(ANOVA) クロス集計 ヒストグラム None 63. ヒストグラムの役割として正しいものは次のうちどれですか? データの平均値を求めるため データの散らばり具合を視覚的に示すため データの因果関係を示すため データの時系列変化を示すため None 64. 主成分分析(PCA)による次元削減の利点は次のうちどれですか? データの欠損値を補完できる 特徴量のスケールを揃えることができる データの分散を最大化しながら次元数を削減できる 非線形関係を取り入れることができる None 65. 回帰分析における「多重共線性」が問題となる理由として正しいものは次のうちどれですか? 特徴量間の独立性が高くなるため。 モデルが過学習しやすくなるため。 回帰係数の推定値が不安定になるため。 クロスバリデーションの結果が無効になるため。 None 66. データを説明する際に「ヒートマップ」を使用する主な目的は次のうちどれですか? 時系列データの変化を示す 2次元データのパターンや相関を視覚化する カテゴリデータの分布を示す 外れ値を特定する None 67. データ加工において、「特徴量生成」が必要になる場面として最も適切なものは次のうちどれですか? データ量が少なく、より多くの情報をモデルに提供したい場合。 外れ値を削除する必要がある場合。 カテゴリ変数を数値データに変換する場合。 欠損値を補完する必要がある場合。 None 68. モデル評価において「リコール(再現率)」が低い場合に考えられる影響として最も適切なものは次のうちどれですか? 誤検知(False Positives)が増加する モデルの計算速度が遅くなる 重要な事例を見逃す可能性が高くなる モデルが適合しすぎる None 69. モデルのパフォーマンスがデータの品質に依存している理由として最も適切なものは次のうちどれですか? データにノイズが含まれていると、モデルの学習が正確に行えないため データが大きいほどモデルの精度が高くなるため データが多いほど、モデルの複雑さを高めることができるため データを使用すれば、必ずモデルのパフォーマンスが向上するため None 70. 「過学習(オーバーフィッティング)」を防ぐために、次のうちどの方法が適切ですか? データを増やすか、正則化を行う 訓練データのみを使用してモデルを評価する モデルの複雑さを高める テストデータを増やす None 71. データ加工で、カテゴリ変数を数値データに変換する手法として正しいものはどれですか? 正規化 ワンホットエンコーディング 標準化 フィルタリング None 72. クラスが不均衡なデータセットにおいて、モデルのパフォーマンスを正確に評価するために推奨される指標は次のどれですか? 精度 AUC-ROC 平均絶対誤差 マクロF1スコア None 73. データの標準化と正規化の違いとして、正しい説明は次のうちどれですか? 標準化はデータを範囲0から1に変換し、正規化はデータの平均を0にする 標準化は数値データにのみ適用され、正規化はカテゴリデータに適用される 標準化と正規化は同じ操作を指す 標準化はデータを平均0、標準偏差1にスケーリングし、正規化はデータを指定された範囲にスケーリングする None 74. データ共有における「分散トレーシング」の目的として最も適切なものは次のうちどれですか? データ共有時の遅延や障害箇所を特定するため。 データ共有プロトコルを統一するため。 データの完全性を保証するため。 データの暗号化を効率化するため。 None 75. 変数間の因果関係を説明するために用いられる「因果モデル」の一例として最も適切なものは次のうちどれですか? 散布図 中央値 ヒストグラム 因果推論モデル(Causal Inference Model) None 76. データの共有において、データの完全性と機密性を保つために使用される技術は次のうちどれですか? 圧縮 暗号化 トークン化 フィルタリング None 77. モデルの利活用において、データが定期的に追加されるシナリオで推奨される手法はどれですか? モデルの完全な再トレーニング 増分学習 モデルのパラメータ調整のみ データの削除 None 78. クラウド環境において、異なるユーザー間でデータを共有する際に考慮すべき主要な課題は次のうちどれですか? データのサイズと圧縮 データのファイル形式 データの権限管理とアクセス制御 データの可視化方法 None 79. モデルの評価において、「再現率」とは何を示しますか? モデルが正しく予測した正解の割合 モデルが間違ったクラスに分類した割合 モデルが全体として正しく予測した割合 モデルが正しく予測したクラス内で、実際にそのクラスに属するものの割合 None 80. データ共有における「REST API」の特徴として正しいものは次のうちどれですか? HTTPプロトコルを使用して、ステートレスな通信を行う リアルタイムのデータ共有をサポートする 大量データのバッチ処理に特化している データを暗号化して転送する None 81. クロスバリデーションの主な目的は何ですか? モデルの性能を評価し、過学習を防ぐこと モデルのパラメータ数を減らすこと モデルの複雑さを増やすこと モデルの学習速度を速めること None 82. データセットにおいて、目的変数が連続値である場合に使用される最も一般的なモデルは次のうちどれですか? ロジスティック回帰 決定木 線形回帰 クラスタリング None 83. 時系列データの予測結果を説明する際に、データのトレンドや季節性を強調するために最も適したグラフは次のうちどれですか? 折れ線グラフ 散布図 棒グラフ 円グラフ None 84. 特徴量選択の手法として「逐次後退選択法(Backward Elimination)」を使用する利点は次のうちどれですか? 全ての特徴量を保持しながらモデルの精度を最大化できる 最も重要でない特徴量を順次削除し、最適な特徴量セットを見つけることができる 特徴量の数を増やすことでモデルの過学習を防ぐことができる カテゴリカルデータを自動的に数値に変換できる None 85. データ共有において、「データレイク」の設計時に最も注意すべき課題は次のうちどれですか? データの検索性と品質を確保すること データの容量を最小化すること データのスキーマを事前に固定すること データの形式をCSVに統一すること None 86. あるデータセットの2つの変数間の関係を可視化するために最も適切なグラフは次のうちどれですか? ヒストグラム 散布図 箱ひげ図 円グラフ None 87. 大規模データセットにおいて、相関関係が高いとされる2つの変数が実際には因果関係を持たないことを示す概念は何ですか? 分散分析 決定係数 標準偏差 偽相関 None 88. 次のうち、「多重共線性」が回帰分析の結果に与える影響として最も適切な説明はどれですか? 説明変数間に強い相関がある場合、回帰係数の解釈が不安定になる データの分布が正規分布でなくなる データの欠損値が増加する 外れ値の影響が強くなる None 89. データ分析でよく使用される「分散分析(ANOVA)」の目的は何ですか? 単一のグループの中央値を求める 2つの変数間の相関を確認する データの時系列分析を行う 複数のグループの平均値の差が有意かどうかを確認する None 90. データ共有において、データの「レプリケーション」を行う目的は次のうちどれですか? データの圧縮率を向上させるため データの暗号化を強化するため データの可用性を高め、システム障害時にもデータアクセスを確保するため データのフォーマットを標準化するため None 91. データの異常値(外れ値)を検出するために用いられる「箱ひげ図」の主な利点は次のうちどれですか? 平均値を明確に表示する データの相関を示す 時系列データを示す 外れ値を視覚的に確認できる None 92. データを扱う際に重要な「分位点」とは何を意味しますか? データを特定の割合で区分した点 データの平均値 データの最大値と最小値の平均 データの標準偏差 None 93. 次のうち、データを説明する際に「ピボットテーブル」を使う主な利点は何ですか? データを無作為に並び替えることができる データの正確性を低下させる データの可視化を自動的に行う データを簡単に集計し、視覚的に示すことができる None 94. デプロイされたモデルの性能を定期的に監視する理由は何ですか? モデルの予測が常に正確であることを確認するため モデルのパラメータを変更するため モデルのトレーニング時間を短縮するため データが変化したときにモデルが適応できるかを確認するため None 95. 散布図で2つの変数間の相関を観察したところ、データがほぼ一直線に並んでいる場合、相関係数は次のうちどれに最も近い値をとると考えられますか? 0 -1 -0.5 1 None 96. 相関係数が正の値を示す場合、次のうちどの関係性があると考えられますか? 2つの変数が同じ方向に動く 2つの変数が逆方向に動く 2つの変数が無関係である 2つの変数が完全に独立している None 97. データの分布が正規分布であるかどうかを視覚的に確認するために最も適切な方法は次のうちどれですか? ヒストグラムを作成して分布を観察する 相関係数を計算する 箱ひげ図を使用する 散布図を作成する None 98. データ共有において、SFTP(Secure File Transfer Protocol)が選ばれる主な理由は次のうちどれですか? リアルタイムでのデータストリームが可能であるため。 非構造化データの転送ができるため。 データ転送の高速性を優先しているため。 データ転送のセキュリティが強化されているため。 None 99. データ共有の際に「分散ファイルシステム」を利用する利点は次のうちどれですか? データを圧縮して保存できる データをリアルタイムで共有できる データの完全性を保証できる 大規模データを複数のサーバーに分散して保存することで、処理速度を向上させることができる None 100. テキストデータの前処理において、「ステミング(Stemming)」とはどのような処理ですか? 単語のスペルミスを修正する処理 テキストを正規化する処理 文章を分割して単語ごとに分類する処理 単語の語幹を抽出し、派生形を統一する処理 None Time's up