MLS-C01 练习题 — MLS-C01:机器学习 - 专项级

AWS认证机器学习 - 专业级 MLS-C01 (已被AIP替代,此科目不再考试)

考试信息

2026-3-31 此科目已停止考试,整合到AIP-C01。

样题

MLS-C01 · Q1
Topic 1 Question #1 一家大型移动网络运营商正在构建一个机器学习模型,用于预测可能取消订阅服务的客户。该公司计划为这些客户提供激励措施,因为客户流失的成本远高于激励措施的成本。 该模型在对包含 100 位客户的测试数据集进行评估后,生成了以下混淆矩阵: " target="_blank" rel="nofollow noopener">https://www.examtopics.com/assets/media/exam-media/04145/0000200001.jpg"> 基于模型评估结果,为什么这是一个适用于生产环境的模型?
  • A.
    该模型准确率为 86%,公司因漏报而产生的成本低于因误报而产生的成本。
  • B.
    该模型的精确度为 86%,低于该模型的准确度。
  • C.
    该模型准确率为 86%,公司因误报而产生的成本低于漏报的成本。
  • D.
    该模型的精确度为 86%,高于该模型的准确度。

答案: A

答案:A. 该模型的准确率为86%,并且公司因假阴性(未预测到流失的客户)而产生的成本低于因假阳性(误判为流失的客户)产生的成本。 中文解析 混淆矩阵分析:真正例(TP): 10 (实际流失 = 是,预测流失 = 是)假正例(FP): 10 (实际流失 = 否,预测流失 = 是)真反例(TN): 76 (实际流失 = 否,预测流失 = 否)假反例(FN): 4 (实际流失 = 是,预测流失 = 否)-准确率计算:准确率 = TP+TN总数=10+76100=0.86\frac{TP + TN}{总数} = \frac{10 + 76}{100} = 0.86,即 86%。-成本分析:问题指出流失成本(假阴性)远高于提供激励的成本(假阳性)。由于假阴性(4)数量较少,模型能够有效识别大部分可能流失的客户,从而最大限度地减少潜在损失。模型的 86% 准确率和可接受的假阳性数量使其具有实际应用价值。-为什么选择 A?:关键在于成本影响。该模型在高准确率的基础上,较少的假阴性符合公司通过预防流失来节省成本的目标。-其他选项分析:B: 精确率(Precision)并不是86%,而是 TPTP+FP=1010+10=0.5\frac{TP}{TP + FP} = \frac{10}{10 + 10} = 0.5(即50%),因此错误。C: 问题关注的是假阴性,而非假阳性,因为假阴性代表未预测到的流失客户,造成的损失更大。D: 精确率低于准确率,因此不正确。-综上所述,A 是正确答案。
MLS-C01 · Q2
Topic 1 Question #2 一位机器学习专家正在为一家公司设计一个提升销售业绩的系统。其目标是利用公司掌握的大量用户行为和产品偏好信息,根据用户之间的相似性来预测用户可能喜欢的产品。 为了实现这一目标,这位专家应该怎么做?
  • A.
    使用 Apache Spark ML 在 Amazon EMR 上构建基于内容的过滤推荐引擎
  • B.
    使用 Apache Spark ML 在 Amazon EMR 上构建协同过滤推荐引擎。
  • C.
    使用 Apache Spark ML 在 Amazon EMR 上构建基于模型的过滤推荐引擎
  • D.
    使用 Apache Spark ML 在 Amazon EMR 上构建组合过滤推荐引擎

答案: B

基于给定的场景,最佳答案是: B. 在亚马逊EMR上使用Apache Spark ML构建协同过滤推荐引擎。 以下是为什么这是最合适的方法: 1. 协同过滤对于此用例非常理想,原因如下: - 它基于用户之间的相似性来预测用户偏好。 - 它利用了公司所拥有的关于用户行为和产品偏好的大量信息。 - 它可以根据相似用户的偏好推荐用户可能喜欢的产品。 2. 在亚马逊EMR上使用Apache Spark ML是一个不错的选择,原因如下: - Spark ML提供了可扩展的机器学习库,包括协同过滤算法。 - 亚马逊EMR(弹性MapReduce)支持对大型数据集进行分布式处理,这对于处理公司的大量用户信息至关重要。 - Spark ML和EMR的结合可以为推荐系统高效地处理和分析大数据。 3. 这种方法与AWS大规模构建推荐系统的最佳实践相一致。 要实施此解决方案: 1. 使用Apache Spark设置一个亚马逊EMR集群。 2. 使用Spark ML的交替最小二乘法(ALS)算法进行协同过滤。 3. 处理并准备用户行为和产品偏好数据。 4. 使用历史数据训练模型。 5. 使用训练好的模型为用户生成产品推荐。 在实施此解决方案时,请记住遵循AWS安全最佳实践,例如: - 使用IAM角色为EMR安全地管理权限。 - 对静态数据和传输中的数据进行加密。 - 为您的EMR集群实施适当的网络安全措施。 有关在亚马逊EMR上使用Apache Spark ML的最新定价、限制和最佳实践信息,请参考AWS官方文档。
MLS-C01 · Q3
Topic 1 Question #3 一家移动网络运营商正在使用 Amazon Athena 和 Amazon S3 构建一个分析平台,用于分析和优化公司运营。 源系统以 .CSV 格式实时发送数据。数据工程团队希望在将数据存储到 Amazon S3 之前将其转换为 Apache Parquet 格式。 哪种解决方案实施起来最省力?
  • A.
    使用 Amazon EC2 实例上的 Apache Kafka Streams 摄取 .CSV 数据,并使用 Kafka Connect S3 将数据序列化为 Parquet 格式。
  • B.
    从 Amazon Kinesis Data Streams 获取 .CSV 数据,并使用 Amazon Glue 将数据转换为 Parquet 格式。
  • C.
    使用 Apache Spark Structured Streaming 在 Amazon EMR 集群中摄取 .CSV 数据,并使用 Apache Spark 将数据转换为 Parquet 格式。
  • D.
    从 Amazon Kinesis Data Streams 获取 .CSV 数据,并使用 Amazon Kinesis Data Firehose 将数据转换为 Parquet 格式。

答案: D

基于给定的场景,实施起来最省力的解决方案是: D. 从亚马逊Kinesis数据流中摄取.CSV数据,并使用亚马逊Kinesis数据消防软管(Amazon Kinesis Data Firehose)将数据转换为Parquet格式。1 以下是为什么这是最有效的解决方案: 1. 设置简单:亚马逊Kinesis数据消防软管是一项完全托管的服务,启动时所需的配置极少。 2. 内置转换功能:Kinesis数据消防软管原生支持将数据从CSV格式转换为Parquet格式,无需额外的编码或基础设施管理。 3. 实时处理:该解决方案可以处理来自源系统的实时数据摄取,符合实时数据处理的要求。 4. 直接集成:Kinesis数据消防软管可以将转换后的Parquet数据直接写入亚马逊S3,这是场景中提到的分析平台的一部分。 5. 无服务器架构:这种方法无需管理任何服务器或集群,降低了运营开销。 6. 可扩展性:Kinesis数据消防软管可以自动扩展以处理不同的数据量,无需人工干预。 要实施此解决方案: 1. 设置一个亚马逊Kinesis数据流,以从源系统摄取CSV数据。 2. 创建一个Kinesis数据消防软管传输流,配置为从Kinesis数据流读取数据。 3. 配置消防软管传输流,将输入格式从CSV转换为Parquet。 4. 将消防软管传输流的目标设置为所需的S3存储桶。2 这种方法为摄取、转换和以所需格式存储数据提供了一种简化的、省力的解决方案,以便使用亚马逊Athena进行分析。 在实施此解决方案时,请记住遵循AWS在安全和数据管理方面的最佳实践,例如使用适当的IAM角色以及对静态数据和传输中的数据进行加密。 参考资料 [1] [[1] 能否使用亚马逊Kinesis数据分析来自S3存储桶的Parquet格式数据 | AWS re:Post] (https://repost.aws/questions/QUEeZ3POOVQCaEUiweF7jeMw/can-use-amazon-kinesis-data-analytics-to-analyse-parquet-format-data-from-s3-bucket) [3] [[2] 转换为列式格式 - 亚马逊Athena] (https://docs.aws.amazon.com/athena/latest/ug/convert-to-columnar.html)
MLS-C01 · Q4
Topic 1 Question #4 某城市希望监测空气质量,以应对空气污染带来的后果。一位机器学习专家需要预测该城市未来两天空气中污染物的浓度(以百万分之几为单位)。由于这是一个原型项目,目前只有过去一年的每日数据可用。 在 Amazon SageMaker 中,哪个模型最有可能提供最佳结果?
  • A.
    对包含全年数据的单个时间序列使用 Amazon SageMaker k-Nearest-Neighbors (kNN) 算法,其中 predictor_type 为 regressor。
  • B.
    对包含全年数据的单个时间序列使用 Amazon SageMaker 随机切割森林 (RCF)。
  • C.
    对包含全年数据的单个时间序列使用 Amazon SageMaker 线性学习器算法,并将 predictor_type 设置为回归器。
  • D.
    对包含全年数据的单个时间序列使用 Amazon SageMaker 线性学习器算法,并将 predictor_type 设置为分类器。

答案: C

基于给定的场景,在亚马逊SageMaker中最有可能为空气质量预测提供最佳结果的模型是: C. 在由全年数据组成的单个时间序列上使用亚马逊SageMaker线性学习器算法,并将predictor_type设置为回归器。 以下是为什么这是最合适的方法: 1. 时间序列预测:该问题是一个时间序列预测任务,即根据历史每日数据预测未来两天的空气质量。 2. 线性学习器:此算法适用于分类和回归问题。在这种情况下,我们正在预测一个连续值(污染物的百万分比浓度),这是一个回归任务。 3. 预测器类型:对于此场景,将predictor_type设置为“回归器”是正确的,因为我们正在预测一个数值,而不是进行分类。 4. 数据兼容性:线性学习器算法可以很好地处理过去一年的每日数据的单个时间序列。 5. 简单性和可解释性:对于数据有限(一年的每日读数)的原型,像线性学习器这样更简单的模型可能表现良好,并提供可解释的结果。 要实施此解决方案: 1. 准备数据:确保您的时间序列数据格式正确,并包含相关特征。 2. 在SageMaker中配置线性学习器算法,将predictor_type设置为“回归器”。1 3. 使用过去一年的每日数据训练模型。 4. 使用训练好的模型预测未来两天的空气质量。 在实施此解决方案时,请记住遵循AWS在安全和数据处理方面的最佳实践。此外,由于这是一个原型,当您收集更多数据并完善模型时,可以考虑评估其他时间序列预测算法,如DeepAR。 有关SageMaker算法和最佳实践的最新信息,请参考AWS官方的SageMaker文档。 参考资料 [1] [[1] 使用亚马逊SageMaker中的推理管道将预处理逻辑部署到单个端点的机器学习模型中 - AWS规范性指导] (https://docs.aws.amazon.com/prescriptive-guidance/latest/patterns/deploy-preprocessing-logic-into-an-ml-model-in-a-single-endpoint-using-an-inference-pipeline-in-amazon-sagemaker.html)
MLS-C01 · Q5
Topic 1 Question #5 数据工程师需要使用包含客户信用卡信息的数据集构建模型。 数据工程师如何确保数据保持加密状态,并确保信用卡信息的安全?
  • A.
    使用自定义加密算法对数据进行加密,并将数据存储在 VPC 中的 Amazon SageMaker 实例上。使用 SageMaker DeepAR 算法对信用卡号进行随机化处理。
  • B.
    使用 IAM 策略加密 Amazon S3 存储桶上的数据,并使用 Amazon Kinesis 自动丢弃信用卡号并插入虚假信用卡号。
  • C.
    使用 Amazon SageMaker 启动配置对复制到 VPC 中 SageMaker 实例的数据进行加密。使用 SageMaker 主成分分析 (PCA) 算法来缩短信用卡号码的长度。
  • D.
    使用 AWS KMS 对 Amazon S3 和 Amazon SageMaker 上的数据进行加密,并使用 AWS Glue 从客户数据中删除信用卡号码。

答案: D

正确答案是 D. 使用 AWS KMS 对 Amazon S3 和 Amazon SageMaker 上的数据进行加密,并使用 AWS Glue 从客户数据中删除信用卡号码。 选择选项 D 的关键原因: 1. 用于加密的 AWS KMS - AWS 密钥管理服务(KMS)是一项用于创建和控制加密密钥的托管服务。它与 Amazon S3(用于对静态数据进行服务器端加密)和 Amazon SageMaker(用于对传输中和静态的数据进行加密,包括模型工件和训练数据)原生集成。这确保了使用经过 AWS 审核的行业标准加密方法进行端到端加密,比使用自定义算法(如选项 A 中那样)更安全。 2. 用于数据删除的 AWS Glue - AWS Glue 是一项完全托管的 ETL(提取、转换、加载)服务,可用于清理和转换数据。具体来说,它可以在预处理期间从数据集中删除(移除或屏蔽)诸如信用卡号码之类的敏感字段。这确保了即使在 SageMaker 中使用数据集进行建模时,敏感信息也不会被泄露。数据删除是数据隐私和合规性(例如,针对信用卡数据的支付卡行业数据安全标准 (PCI-DSS))的关键部分。 3. 安全最佳实践 - 避免使用自定义解决方案:选项 A 使用了自定义加密算法,这存在风险(自定义算法可能存在漏洞),并且在 AWS 提供像 KMS 这样安全的托管解决方案时,使用自定义算法是不必要的。 - IAM 策略的局限性:选项 B 错误地将 IAM 策略用于加密。IAM 用于管理访问控制,而不是数据加密。加密需要像 KMS 或 S3 服务器端加密(SSE)这样的服务。 - PCA 的误用:选项 C 建议使用主成分分析(PCA)来“缩短信用卡号码的长度”,这是不正确的。PCA 是一种降维技术,而不是数据屏蔽或删除工具。信用卡号码必须明确地被删除或进行标记化处理,而不是通过 PCA 进行修改。 实施步骤: 1. 在 Amazon S3 中加密数据: - 启用使用 KMS 管理的密钥的 S3 服务器端加密(SSE-KMS),以对存储在 S3 中的静态信用卡数据进行加密。 2. 使用 AWS Glue 删除敏感数据: - 使用 Glue ETL 作业处理数据集,在数据被用于 SageMaker 之前识别并从数据中删除信用卡号码。这可以通过使用正则表达式或内置的数据屏蔽函数来完成。 3. 确保 SageMaker 工作流程的安全: - 配置 SageMaker 使用 KMS 密钥在训练和推理期间对数据进行加密。将 SageMaker 实例托管在私有虚拟专用云(VPC)中以实现网络隔离。 4. 访问控制: - 使用 IAM 角色为 S3、Glue 和 SageMaker 授予最小权限访问,确保只有经过授权的用户/进程可以与数据进行交互。 合规性与安全一致性: 这种方法通过结合加密(KMS)、数据删除(Glue)和安全的基础设施(VPC、IAM),符合 AWS 处理敏感数据的最佳实践(例如,针对信用卡数据的 PCI-DSS 要求)。它避免了像自定义加密或滥用算法进行数据屏蔽这样不安全的做法,确保了安全性和合规性。

常见问题

MLS-C01 有多少道练习题?

本题库收录 MLS-C01 练习题共 369 道,含单选、多选等题型,每题配有答案与解析。

MLS-C01 练习题支持中英文吗?

支持,MLS-C01 练习题为中英双语对照,便于对照原文理解。

MLS-C01 练习题可以免费试做吗?

可以,本页提供免费样题在线试做;完整题库可在掌学兔注册后获取。