DS検定~模擬試験③~ 2024年12月7日 ailearn 1. データサイエンスにおける「転移学習(Transfer Learning)」の最新動向として、最も適切なものは次のうちどれですか? モデルをゼロから学習させる手法 全てのデータを破棄する手法 データ前処理を無視する手法 既存のモデルの知識を利用して、新しいタスクに応用する手法 None 2. 次元削減後のデータを可視化するために、UMAPの利点は何ですか? 高次元データの構造を保持しやすい 可視化が容易なため、データの理解が進む 計算が早く、大規模データにも適応できる 全てが利点 None 3. ラベルエンコーディングを使用する場合、どのような問題が発生する可能性がありますか? カテゴリ間に序列が生じてしまう 外れ値が増加する データの次元が増加する 欠損値が生じる None 4. AIとデータサイエンスの最新技術「GAN(Generative Adversarial Networks)」の主な役割は次のうちどれですか? データの正規化 データの生成 データの欠損補完 モデルの評価 None 5. 現在、AI技術が急速に進展している分野として最も適切なものは次のうちどれですか? 自動運転車 書籍の出版 手作業での農業 古典芸術の制作 None 6. 欠損データを補完するための「多重代入法(Multiple Imputation)」の主な利点として正しいものは次のうちどれですか? 欠損値を平均値で簡単に補完できる。 欠損データの影響を無視するモデルを作成できる。 欠損データに関する不確実性を考慮できる。 欠損データの除外を容易にする。 None 7. データのクレンジングを行う際に考慮すべき要素として最も適切なものは次のうちどれですか? データを全て再収集すること データの正規化を優先すること データの一部を削除すること データの一貫性、重複、欠損を修正し、分析に適した状態に整えること None 8. データ蓄積において、データウェアハウスの主な利用目的は何ですか? データを短期間だけ保存すること データをリアルタイムで処理すること データを圧縮して保存すること 大量のデータを分析するためにデータを集約すること None 9. 分散データベースのレプリケーション方式の一つである「マスタースレーブレプリケーション」の特徴は何ですか? 全てのサーバーが同時に書き込みと読み込みを行う データがリアルタイムで同期される データベースのスケーリングが不可能である マスターサーバーが書き込みを担当し、スレーブサーバーが読み込みを担当する None 10. ヘルスケア分野でAIが導入されている例として、患者モニタリングシステムの主な目的は次のうちどれですか? 医療記録の自動削除 患者のバイタルサインをリアルタイムで監視し、異常を検知する 薬剤の価格を一括管理する 病院のスタッフスケジュールを最適化する None 11. 農業分野におけるAIの利活用として最も効果的なものは次のうちどれですか? 農作物の種類をAIが決定する AIを利用して農作物の成長を監視し、収穫時期を最適化する 農業のすべての作業をAIに任せる 気象予測を無視して作業を進める None 12. 大規模データの保存に適した「Hadoop HDFS(Hadoop Distributed File System)」の主な特性は次のうちどれですか? データを高速で検索できるインデックス機能を持つ データをリアルタイムで処理する 大規模なデータセットを分散して保存し、冗長性を確保する トランザクションを強力にサポートする None 13. 欠損データが大規模に発生しているデータセットに対して最も適切な処理方法は次のうちどれですか? モデルを用いて欠損値を予測し、補完する 欠損値をすべて削除する 欠損値をそのまま残し、他のデータで分析する 欠損値をランダムな値で埋める None 14. カテゴリカルデータの頻度分布を視覚化する際に最も適したグラフはどれですか? 散布図 ヒストグラム 棒グラフ 箱ひげ図 None 15. データセット内の外れ値を可視化するために最も適したグラフはどれですか? 箱ひげ図 ヒストグラム 散布図 円グラフ None 16. 大規模データセットのサンプリングを行う際の注意点として最も重要なものは次のうちどれですか? サンプルが全体のデータを代表するものであること サンプルがランダムに選ばれていること サンプルが欠損データを含まないこと サンプルが少ない方が効率的な分析ができること None 17. AI技術が進化する中で、プライバシー保護に対する最新の対応策として注目されている技術は次のうちどれですか? 中央集権的なデータ管理 データの分散処理やフェデレーテッドラーニングの導入 データの完全な公開 データの一元的な収集 None 18. 生成AIを活用した「フェイクニュース検出システム」の主な課題として最も適切なものは次のうちどれですか? 検出精度の向上によるコスト増加 システムの運用におけるサイバー攻撃のリスク増加 AIが誤って正確な情報をフェイクニュースと判断する可能性 検出システムが大規模データを処理できない None 19. データ蓄積において、データの冗長性を減らし、効率的に保存するために使用される技術は何ですか? 正規化 非正規化 分割統治 シャーディング None 20. アプローチ設計において「リスク軽減策」として「リスク共有」が選択される状況として最も適切なものは次のうちどれですか? 特定のリスクが他のステークホルダーと共有可能な場合 プロジェクトリーダーが全てのリスクを管理できる場合 リスクが重大であり、プロジェクトを中止する必要がある場合 リスクが発生しても影響が軽微である場合 None 21. データの種類を理解する上で、次のうち「構造化データ」とはどのようなものを指しますか? 一定の形式で組織化されたデータ 画像や動画などの形式を持たないデータ センサーデータなどのリアルタイム情報 データ収集の途中で不完全なデータ None 22. カテゴリカルデータを機械学習モデルに使用するための一般的な手法はどれですか? 平均値で補完する 標準化する One-hotエンコーディングを使用する 中央値で補完する None 23. 分散データベースにおいて、「クエーリーのシャーディング」は何を目的としていますか? クエリを複数のデータサーバーに分散させ、パフォーマンスを向上させる クエリを自動で最適化する クエリを圧縮してデータ転送速度を上げる クエリのエラーを自動修正する None 24. AIが「農業分野」で導入されることで最も期待される効果は次のうちどれですか? 作物の成長管理を自動化し、生産性と収穫量を最大化する 作物の品種をすべて統一する 作物の管理をすべて手動で行う 農業分野ではAIが使われない None 25. 最新のAI倫理に関する議論で注目されている課題は次のうちどれですか? AIによるバイアスや公平性の問題 AIがすべての仕事を自動化すること AIの使用を完全に禁止すること AIによるデータ削除 None 26. データ分析における「エンコーディング」とは、どのようなプロセスを指しますか? カテゴリデータを数値データに変換するプロセス データの欠損を補完するプロセス 時系列データを分析するためのプロセス データのクレンジングを行うプロセス None 27. 時系列データの自己相関を考慮したモデルを構築する際に使用される適切な手法は次のうちどれですか? ARIMAモデル ロジスティック回帰 k-近傍法 主成分分析 (PCA) None 28. 相関行列の可視化に使用される一般的な手法はどれですか? 散布図 円グラフ 箱ひげ図 ヒートマップ None 29. カテゴリカルデータをエンコードする際、One-hotエンコーディングを使用する理由は何ですか? カテゴリ間に序列がある場合のエンコードが容易であるため カテゴリカルデータが数値データとして扱われるようになるため カテゴリカルデータ間に意味のない序列が生じるのを防ぐため カテゴリカルデータの次元が増加しないため None 30. データベースの「トランザクション分離レベル」において、最も強い整合性を保証するレベルはどれですか? Read Committed Repeatable Read Serializable Read Uncommitted None 31. データ理解のために行う「相関分析」の目的は次のうちどれですか? データの分布を確認するため 時系列データの予測を行うため 2つの変数間の関係性を測定するため 欠損値を補完するため None 32. データ蓄積において「データウェアハウス」と「データレイク」の主な違いとして正しいものは次のうちどれですか? データウェアハウスはスキーマを事前に定義する必要があるが、データレイクはスキーマが不要である。 データウェアハウスは非構造化データに特化しているが、データレイクは構造化データに特化している。 データウェアハウスはクラウド環境でしか使用できないが、データレイクはオンプレミス環境でしか使用できない。 データウェアハウスは主にデータ保存に使用されるが、データレイクはデータ分析専用である。 None 33. 大規模な欠損値を含むデータセットに対して、単純な平均補完では不十分な場合に推奨される手法は何ですか? k-近傍補完 (k-NN Imputation) 平均補完 欠損データの削除 モード補完 None 34. データ理解において、「データの分布」を確認する理由として最も適切なものは次のうちどれですか? データの傾向や偏りを把握するため データの欠損箇所を確認するため データの統合方法を検討するため データの収集元を特定するため None 35. AIを活用した農業の最新技術として、農作物の生育状況をリアルタイムでモニタリングするシステムが注目されています。この技術が最も貢献する分野は次のうちどれですか? 労働力の削減 農地の拡大 水資源の保護 農産物の輸出拡大 None 36. データ蓄積における「Cold Storage」とはどのようなデータを保存するためのものですか? 頻繁にアクセスされないが、長期的に保存する必要があるデータ 高速でアクセスされるリアルタイムデータ セキュリティが強化されたデータ データベース内のインデックス情報 None 37. 変数の相関を表すために、次のうち誤りの少ないグラフの種類はどれですか? 散布図 円グラフ 棒グラフ 箱ひげ図 None 38. 最近注目されている生成AI技術に関連し、企業が「テキスト生成AI」を活用する際の主な目的として最も適切なものは次のうちどれですか? データの保存容量を削減する カスタマーサポートやコンテンツ作成を効率化する AIモデルの透明性を向上させる データ分析の速度を向上させる None 39. 複雑なプロジェクトにおける「クリティカルパス分析」の目的は次のうちどれですか? プロジェクト全体の進行において、遅延が最も影響を与えるタスクを特定するため プロジェクト全体のタスクを短縮するため すべてのタスクを同時に完了させるため コストを最小限に抑えるため None 40. 最新のAI技術「フェアネスアウェアネス(Fairness Awareness)」の目的は次のうちどれですか? AIが判断する際に、公平性を確保し、特定のグループに不利益が生じないようにする AIの結果をランダムに決定する AIの判断を全て手動で行う 公平性を考慮せずにAIを訓練する None 41. 高次元データを可視化するための次元削減手法として「t-SNE」を使用する場合の注意点は次のうちどれですか? t-SNEは計算速度が非常に速いため、大規模データにも適している。 t-SNEは教師あり学習にのみ使用可能である。 t-SNEはカテゴリカルデータのみに適用可能である。 t-SNEは局所的な構造を重視するため、大域的な構造を把握しづらい。 None 42. データベースにおける「インデックス」の主な目的は何ですか? データの保存容量を削減する データの検索を高速化する データのバックアップを取る データを圧縮する None 43. データの標準化と正規化の違いとして正しいものはどれですか? 標準化はデータの分布を均一化し、正規化はデータを特定の範囲にスケーリングする 標準化は欠損値を補完し、正規化は外れ値を除外する 標準化はデータを整数に変換し、正規化は分散を一定にする 標準化と正規化は同じ意味で使用される None 44. NoSQLデータベースの特徴として正しいものはどれですか? トランザクションのサポートが強力である 関係データベースの一種である スキーマが柔軟である クエリはSQLで書く必要がある None 45. スマートシティの実現において、AIが果たす役割として最も重要なものは次のうちどれですか? 都市計画を完全に自動化する 全ての市民サービスをAIに置き換える 都市内のすべてのビルを自動的に設計する 交通管理やエネルギー消費の最適化など、都市運営を効率化する None 46. データ蓄積において、「ACID特性」を持つシステムで保証される一貫性とは次のうちどれですか? すべてのトランザクションが同時に実行されること。 トランザクションが中断された場合でも、データの整合性が保たれること。 データが並列処理中もリアルタイムで同期されること。 データが圧縮されて効率的に保存されること。 None 47. データ可視化において、変数の密度分布を滑らかに表現するために使用される手法はどれですか? ヒストグラム KDE(カーネル密度推定) 散布図 箱ひげ図 None 48. データのバイアスを取り除くための適切な手法は次のうちどれですか? 標準化 無作為抽出 欠損値補完 正規化 None 49. AIが金融業界で最新のトレンドとなっている「AI取引」とは何ですか? 全ての取引をAIが管理する手法 AIが手動で取引を支援する手法 AIが取引を禁止する手法 AIがリアルタイムで市場データを分析し、自動的に取引を行う手法 None 50. AIを活用した交通管理システムにおいて、最も一般的な目的は次のうちどれですか? 交通事故のデータを削除する 信号の故障を予測する 渋滞の予測とリアルタイム交通制御 車両の登録情報を一括管理する None 51. 小売業界でAIを活用した「パーソナライズ広告配信」が注目されています。このシステムが特に効果を発揮する状況として最も適切なものは次のうちどれですか? 顧客の好みに基づいた広告をリアルタイムで配信する場合 顧客の購入履歴が乏しい場合 全顧客に同じ広告を一斉配信する場合 広告費を大幅に削減したい場合 None 52. アプローチ設計における「フィードバックループ」の役割は次のうちどれですか? プロジェクトの進行中に、得られた結果やデータを基に改善策を導入する プロジェクト完了後に成果を報告する プロジェクトの最初に課題を定義する プロジェクトのリソースを最適化する None 53. アプローチ設計において、「PoC(概念実証)」を実施する主な目的は次のうちどれですか? プロジェクト全体の成功を保証するため 提案された解決策が技術的および実用的に可能であることを確認するため プロジェクトスコープを明確にするため ステークホルダーの意見を完全に反映するため None 54. 時系列データの特性として、次のうち正しいものはどれですか? データが一貫して変動しない データがランダムに取得される データが構造化されていない 時間に沿った順序が重要である None 55. テキストデータの「トークン化」が重要視される理由は次のうちどれですか? データの分布を確認するため 非構造化データを完全に削除するため 生データを構造化し、機械学習モデルで扱いやすくするため データを視覚化するため None 56. アプローチ設計において「データ駆動型の意思決定」が重視される理由として最も適切なものは次のうちどれですか? データを基にリスクを最小限に抑えるため 主観的な判断を避け、客観的なデータに基づいて解決策を選択するため データを活用して迅速な意思決定を行うため すべてのステークホルダーの意見を反映させるため None 57. AIが金融業界で行う「不正検知システム」の特徴として正しいものは次のうちどれですか? 不正取引を手動で確認する 顧客のデータを削除する 全ての取引を同一基準で扱う 顧客の取引データをリアルタイムで分析し、異常なパターンを検出する None 58. 次のうち、データのスケーリングを行う方法として正しいものはどれですか? データの最小値と最大値を使用してスケーリングする データの中央値を使用してスケーリングする データの範囲を倍にする データの外れ値を除去する None 59. アプローチ設計において「ウォーターフォールモデル」が適している状況は次のうちどれですか? 要件が明確で、変更が予想されない場合 短期間で頻繁なフィードバックが必要な場合 チームが独立して作業できる場合 顧客要件がプロジェクト期間中に変化する可能性が高い場合 None 60. 大量のデータポイントが重なり合って見にくい場合、散布図でデータの密度を表現するために使用される手法はどれですか? ジッタリング ログ変換 ヒートマップ バイオリンプロット None 61. 大規模データセットのサンプリングを行う際に、サンプリングバイアスを防ぐために重要な手法はどれですか? 系統抽出 ランダムフォレストを使用する クロスバリデーション 無作為抽出 None 62. カテゴリカルデータの頻度分布を視覚化するための最も適したグラフは次のうちどれですか? 棒グラフ 散布図 ヒストグラム 折れ線グラフ None 63. データサイエンスの最新動向において、「フェデレーテッドラーニング(Federated Learning)」がもたらす利点として正しいものは次のうちどれですか? 中央集権的に全てのデータを収集する 全てのデータを公開する 個々の端末でデータを学習し、プライバシーを保護する 分散学習を排除する None 64. データの標準化を行う際、標準偏差が0に近い場合、次のうちどの問題が発生しますか? 外れ値が検出されない データがスケーリングされない 分散がゼロとなり、標準化できない 平均値が歪む None 65. データの「拡張現実(AR)」に関する最新技術の応用例として最も適切なものは次のうちどれですか? ARを使って建築物の仮想設計を行う ARを使ってデータの圧縮を行う ARを使って音声データの解析を行う ARを使って市場データを分類する None 66. データベースにおける「レプリケーション」の目的は何ですか? データの保存容量を減らす データの暗号化を行う データのスキーマを自動生成する データの可用性を高め、障害に対する耐性を向上させる None 67. データ蓄積における「キャッシング」の主な目的は次のうちどれですか? 頻繁にアクセスされるデータを一時的に高速メモリに保存して、応答時間を短縮する データを圧縮して保存することで、ストレージの使用量を減らす データのバックアップを取るためのメカニズム データを暗号化して保存すること None 68. 複数の変数間の関係を示す散布図を一つの可視化に統合して表示する手法はどれですか? ヒストグラム 散布図行列 折れ線グラフ 円グラフ None 69. アプローチ設計において「データ駆動型の意思決定」が最も重要になる状況として適切なものは次のうちどれですか? データが少なく、意思決定に経験が優先される場合 データの品質が低い場合 データが豊富で、意思決定が複数の利害関係者に影響を与える場合 短期間で感覚的な意思決定が必要な場合 None 70. ヒストグラムと箱ひげ図(ボックスプロット)の違いとして正しいものは次のうちどれですか? ヒストグラムは分布の形状を、箱ひげ図は分散や異常値を示す。 ヒストグラムはカテゴリデータ、箱ひげ図は数値データに使用する。 箱ひげ図は分布の形状を示し、ヒストグラムは平均値を強調する。 ヒストグラムと箱ひげ図は同じ目的で使用される。 None 71. アプローチ設計において、目標を「具体的・測定可能・達成可能・関連性がある・期限付き」(SMART)の形で設定する理由は何ですか? チーム全体で共通の理解を持ち、進捗を測定できるようにするため 目標を柔軟に変更できるようにするため コストを最小限に抑えるため 目標を簡単に達成するため None 72. アプローチ設計において「スプリント」という概念は、次のどの手法に関連していますか? ウォーターフォール手法 アジャイル手法 リーンスタートアップ デザイン思考 None 73. データベースでのACID特性のうち、"I"が示すものはどれですか? Isolation(独立性) Integrity(整合性) Indexing(インデックス化) Immutability(不変性) None 74. 「時系列データ」の特徴として、分析時に特に考慮すべき事項は次のうちどれですか? 時系列データはすべて独立している 時系列データには季節性が存在しない 時系列データは常に正規分布に従う 時系列データの値は、時間の経過とともに相関が生じることが多い None 75. 「強化学習」が活用される最新の分野として最も適切なものは次のうちどれですか? 自動化されたゲームのプレイ 音声データのリアルタイム解析 データの前処理 テキスト生成 None 76. AIが「マーケティング分野」において特に効果的に活用されている例として正しいものは次のうちどれですか? 顧客データを削除する 顧客の購買行動データを分析し、パーソナライズされた広告を提供する 顧客に対して無作為に広告を配信する 顧客行動を分析しない None 77. AIを活用した「生成AI(Generative AI)」の最新の応用例として最も適切なものは次のうちどれですか? データの削除 音声データのリアルタイム分析 手作業によるデータ入力 画像やテキストの自動生成 None 78. アプローチ設計における「フェーズゲート法」とは何ですか? プロジェクトの各フェーズごとに進行状況を評価し、次のフェーズに進むかどうかを判断する手法 各フェーズでチームの成果を報告する手法 プロジェクト全体を一度に評価し、終了するタイミングを決定する手法 各フェーズごとに異なる解決策を適用する手法 None 79. 最新のAI技術「ディープフェイク」がもたらす社会的なリスクとして最も適切なものは次のうちどれですか? AIの導入が遅れる データの削除 動画の圧縮 動画や音声の不正な生成による情報操作や詐欺の増加 None 80. データ準備において、データ型の整備を行う主な理由として最も適切なものは次のうちどれですか? データのメモリ使用量を削減するため。 モデルがデータを正しく処理するため。 データの視覚化が不要になるため。 欠損値を補完するため。 None 81. データの分布を視覚化するために最も適したグラフは次のうちどれですか? ヒストグラム 棒グラフ 散布図 箱ひげ図 None 82. データサイエンスの最新技術として「自動機械学習(AutoML)」の目的は次のうちどれですか? 機械学習モデルの構築プロセスを自動化し、専門知識がなくても高性能なモデルを作成できるようにする データの収集を自動化する データの前処理を行う モデルの評価を手動で行う None 83. 複数の解決策を比較するために「コストベネフィット分析」を使用する際、考慮すべき要素として適切なものは次のうちどれですか? 各解決策のコストと、それに伴う利益や効果 各解決策にかかる時間とリスク 各解決策に必要なリソースと技術的難易度 各解決策の影響範囲と利益率 None 84. 外れ値が多く含まれるデータセットを扱う際、最も適切な手法は次のうちどれですか? 外れ値を全て削除する 外れ値を中央値で補完する 外れ値に対してロバストな手法を使用する 外れ値を全て0にする None 85. 分散データベースにおける「CAP定理」の3つの要素に該当しないものは次のうちどれですか? Consistency(整合性) Availability(可用性) Partition Tolerance(分割耐性) Performance(性能) None 86. データ理解のプロセスで、「データのバイアス」を検出する主な目的として最も適切なものは次のうちどれですか? バイアスが分析結果や意思決定に及ぼす影響を評価するため バイアスを削除してモデル精度を上げるため データにバイアスが含まれていないことを証明するため バイアスを活用してモデルの性能を向上させるため None 87. 時系列データの分析において、データのトレンドを除去するための手法はどれですか? データの標準化 移動平均法 クラスタリング カイ二乗検定 None 88. AIが医療現場で活用される例として最も適切なものは次のうちどれですか? 手術を全自動で行う 診断支援システムとして活用し、画像診断の精度を向上させる 医師の役割をすべて代替する 患者のコミュニケーションを代行する None 89. 欠損値がMCAR(Missing Completely at Random)ではなくMAR(Missing at Random)の場合に推奨される欠損値処理方法は次のうちどれですか? 欠損値を無視して分析を続ける。 欠損値を平均値で補完する。 欠損値の補完に予測モデルを使用する。 欠損データを全て削除する。 None 90. 欠損データの削除を行う際に、重要な注意点は次のうちどれですか? 削除されたデータが分析結果に与える影響を考慮する 欠損データの量にかかわらず、全て削除する 欠損値をランダムに削除する 欠損データが少ない場合でも多重代入法を使用する None 91. AIを活用したチャットボットが主に導入されている領域は次のうちどれですか? 販売促進 顧客サービス 財務管理 製品設計 None 92. AIによる「異常検知システム」が製造業に導入されることで得られる主な利点は次のうちどれですか? 製品の品質を無視する 製造コストが増加する AIによる検知が不正確になる 製品の不良品や設備の異常をリアルタイムで検出し、早期に対応できる None 93. ビッグデータの分析において「分散処理」が必要とされる理由は次のうちどれですか? データの重複を防ぐため 大規模データを効率的に処理するために、データを複数のマシンに分散して処理する必要があるため データをより高速に削除するため 分析結果を分割して表示するため None 94. 高次元データのクラスタリング結果を2次元で可視化するために推奨される手法はどれですか? 箱ひげ図 散布図 t-SNE ヒートマップ None 95. アプローチ設計における「バックキャスティング」とはどのような方法を指しますか? 現在の状況を分析して未来を予測する方法 未来の目標から逆算して現在取るべき行動を決定する方法 過去のデータを基に分析を行う方法 現在の制約条件を優先して設計を行う方法 None 96. アプローチ設計において「デザイン思考」が重要とされる理由は次のうちどれですか? データに基づく精密な分析を行うため コスト削減を最優先するため 競合分析を徹底的に行うため ユーザー中心の視点から問題解決策を創造するため None 97. 「外れ値(アウトライヤー)」を理解する際に重要な点は次のうちどれですか? 他のデータから大きく離れた値が、全体の傾向を歪める可能性があるため 外れ値は常に無視すべきものであるため 外れ値を取り除くことで、分析結果が必ず正確になるため 外れ値は分析に関係しないため None 98. アプローチ設計における「アジャイル手法」の特徴として正しいものは次のうちどれですか? 事前に詳細な計画を立て、変更を最小限に抑える プロジェクトの全体像を一度に完了させる 柔軟に対応し、短期間で反復的に成果を出すことができる 固定されたスケジュールで一貫して進行する None 99. データ可視化の際、複数の変数間の非線形な関係を検出するために適したグラフは次のうちどれですか? 散布図行列(Pair Plot) ヒートマップ 棒グラフ 箱ひげ図 None 100. 非構造化データを効率的に処理するために使用される技術として最も適切なものは次のうちどれですか? 正規化 相関分析 主成分分析(PCA) 自然言語処理(NLP) None Time's up