DEA-C01 练习题 — DEA-C01:数据工程师 - 助理级

1、题库联网,会自动更新,无需重新获取;

2、激活题库,可同时拥有中英文的访问权限;

3、包含在线练习,模拟测试,PDF下载,视频课程;

4、可使用小程序,或电脑网页端刷题学习,有效期一年;

5、激活码可直接购买,或通过天猫旗舰店购买;

6、有问题可通过微信,whatsapp,Line联系客服;

考试信息

数据工程师 - 助理级  考试代码:DEA-C01


·报名链接:https://aws.amazon.com/cn/certification/certification-prep/testing/

·考试费用:150美金。可以购买考试券,价格在750RMB左右(考试券购买: https://item.taobao.com/item.htm?id=991899961156 )。

·考试语言:简体中文、英文,日语等。不同语言证书含金量一样,用中文考,也可以下载英文证书。

·考试地点:可在对应城市的线下Pearson VUE考点,也可以使用自己的电脑在线考试(考试全程开摄像头,不要想着作弊哦)。

·考试环境:在线考试时需要背景简洁,不能有噪音,有条件可申请公司会议室,并多备一个网络(不一定需要VPN)。

·考试时长:130分钟。考完一个工作日内会通过邮件发送成绩单。

·考试题型:65道选择题,总分1000分,成绩720分以上即可通过。

样题

DEA-C01 · Q1
Topic 1 Question #1 一位数据工程师正在配置一个 AWS Glue 作业,以从 Amazon S3 存储桶读取数据。该数据工程师已设置了必要的 AWS Glue 连接详细信息和关联的 IAM 角色。但是,当该数据工程师尝试运行 AWS Glue 作业时,收到一条错误消息,指出 Amazon S3 VPC 网关终端节点存在问题。 该数据工程师必须解决此错误并将 AWS Glue 作业连接到 S3 存储桶。 哪个解决方案可以满足此要求?
  • A.
    更新 AWS Glue 安全组,允许来自 Amazon S3 VPC 网关终端节点的入站流量。
  • B.
    配置 S3 存储桶策略,明确授予 AWS Glue 作业访问 S3 存储桶的权限。
  • C.
    检查 AWS Glue 作业代码,确保 AWS Glue 连接详细信息包含完全限定域名。
  • D.
    验证 VPC 的路由表是否包含 Amazon S3 VPC 网关终端节点的入站和出站路由。

答案: D

本题明确报错指向Amazon S3 VPC网关终端节点问题,首先需要回忆S3网关终端节点的核心工作原理:S3网关终端节点属于网关型私有终端节点,无需修改应用访问地址,完全依赖VPC路由表的路由规则实现VPC内部资源到S3的私有访问。运行在VPC内的AWS Glue作业访问S3时,流量需要通过路由表中关联S3网关终端节点的条目完成转发,如果路由表缺少对应的入站和出站路由规则,就会触发终端节点相关的访问错误。选项D的操作正是针对S3网关终端节点配置的核心排查点,修复路由配置后即可让Glue作业通过VPC网关终端节点正常访问S3,完全匹配题目要求。 各选项分析: A. 错误。S3 VPC网关终端节点是网关型终端节点,不涉及安全组规则配置,安全组是EC2等实例级别的访问控制组件,且Glue访问S3是主动发起的出站请求,不需要允许S3终端节点的入站流量,该操作无法解决终端节点路由相关的错误。 B. 错误。题目已经明确报错原因是S3 VPC网关终端节点问题,且题干说明已配置了必要的关联IAM角色,权限不足的问题不会触发终端节点相关的错误提示,因此该方案不匹配当前场景。 C. 错误。S3网关终端节点不需要修改访问S3的域名,仍使用默认的S3服务端点,不需要配置完全限定域名,Glue连接S3的配置也无强制FQDN要求,该操作与终端节点错误无关。 D. 正确。S3网关终端节点生效的必要前提是VPC及Glue作业所属子网关联的路由表中,存在目标为S3服务前缀列表、下一跳为S3网关终端节点的路由规则,覆盖S3访问的入站和出站流量,验证并修复路由配置即可解决题目中的报错。 关键知识点: 1. S3 VPC网关终端节点配置要求:网关型终端节点仅支持S3和DynamoDB,无需修改应用访问端点,必须通过在关联路由表中添加指向S3前缀列表的路由条目实现流量转发。 2. AWS Glue VPC作业网络访问规则:运行在用户自定义VPC中的Glue作业,访问AWS服务时如果使用私有终端节点,需确保子网关联的路由表、终端节点权限等配置符合要求。 3. VPC终端节点类型差异:网关型终端节点无需安全组配置,仅通过路由表和终端节点策略控制访问,与需要安全组配置的接口型终端节点配置逻辑完全不同。 参考资料: AWS 私有链路S3网关终端节点配置指南, https://docs.aws.amazon.com/zh_cn/vpc/latest/privatelink/vpc-endpoints-s3.html AWS Glue VPC环境配置官方文档, https://docs.aws.amazon.com/zh_cn/glue/latest/dg/set-up-vpc.html
DEA-C01 · Q2
Topic 1 Question #2 一家零售公司在亚马逊S3存储桶中建立了一个客户数据中心。来自多个国家的员工使用该数据中心来支持公司范围内的数据分析。公司治理团队必须确保公司的数据分析师只能访问与其位于同一国家/地区的客户数据。 哪种解决方案能够以最小的运维成本满足这些要求?
  • A.
    为每个国家/地区的客户数据创建单独的表格。根据分析师服务的国家/地区,为每位分析师提供相应的访问权限。
  • B.
    将 S3 存储桶注册为 AWS Lake Formation 中的数据湖位置。使用 Lake Formation 的行级安全功能来强制执行公司的访问策略。
  • C.
    将数据迁移到靠近客户所在国家/地区的 AWS 区域。根据分析师服务的国家/地区,为每位分析师提供相应的访问权限。
  • D.
    将数据加载到 Amazon Redshift 中。为每个国家/地区创建一个视图。为每个国家/地区创建单独的 IAM 角色,以便访问来自该国家/地区的数据。将相应的角色分配给分析师。

答案: B

本题核心需求是在现有S3存储客户数据的基础上,实现分析师仅能访问所属国家客户数据的细粒度权限控制,同时要求运维成本最低。AWS Lake Formation是专门用于构建、管理和保护数据湖的服务,其行级安全功能可以直接针对S3上存储的现有数据,基于数据行中的国家字段定义过滤策略,无需对底层数据进行拆分、迁移或复制,也无需创建大量额外的资源,仅需要在统一的Lake Formation控制台配置访问规则即可实现需求,运维成本远低于其他方案,因此选择B选项。 各选项分析: A. 该方案需要为每个国家拆分创建独立表格,随着国家数量增加,表格数量会持续膨胀,后续需要为每个新增国家单独建表、为每个分析师单独配置对应表的访问权限,运维成本极高,且数据更新时需要同步维护多个表,容易出现数据不一致问题,不符合最小运维成本要求,因此错误。 B. 该方案利用Lake Formation原生的行级安全功能,无需改动现有S3数据的存储结构,仅需要配置基于国家字段的行过滤策略,即可自动限制每个分析师仅能看到所属国家的客户数据,权限配置和后续维护都可以在Lake Formation统一完成,运维成本最低,完全满足题目要求,因此正确。 C. 该方案需要将现有S3数据迁移到多个国家对应的AWS区域,不仅会产生高额的数据迁移成本和多区域存储成本,还需要维护多区域的访问权限,运维复杂度极高,且完全没有必要改动现有数据的存储位置,因此错误。 D. 该方案需要将S3数据额外加载到Amazon Redshift中,产生额外的计算和存储成本,同时需要为每个国家创建独立视图和对应IAM角色,随着国家数量增加,视图和角色的维护成本会持续上升,运维成本远高于B选项,因此错误。 关键知识点: 1. AWS Lake Formation行级过滤功能,允许用户基于数据行的属性字段定义细粒度访问策略,无需拆分底层数据即可实现不同主体访问不同行数据的权限控制需求。 2. 数据治理中的成本优化原则,实现访问控制需求时优先选择不改动现有数据存储架构、不需要额外复制或迁移数据的方案,降低运维和资源开销。 3. 数据湖统一权限管理能力,Lake Formation可以集中管理S3数据湖的元数据和细粒度访问权限,减少多服务权限配置的运维复杂度。 参考资料: AWS Lake Formation 行级过滤官方文档, https://docs.aws.amazon.com/lake-formation/latest/dg/row-level-filtering.html AWS Certified Data Engineer - Associate (DEA-C01) 官方考试指南, https://aws.amazon.com/certification/certified-data-engineer-associate/
DEA-C01 · Q3
Topic 1 Question #3 一家媒体公司希望改进其基于用户行为和偏好向客户推荐媒体内容的系统。为了改进推荐系统,该公司需要将第三方数据集的洞察整合到其现有的分析平台中。 该公司希望尽可能减少整合第三方数据集所需的工作量和时间。 哪种解决方案能够以最低的运营成本满足这些要求?
  • A.
    使用 API 调用访问和集成来自 AWS Data Exchange 的第三方数据集。
  • B.
    使用 API 调用从 AWS DataSync 访问和集成第三方数据集。
  • C.
    使用 Amazon Kinesis Data Streams 访问和集成来自 AWS CodeCommit 存储库的第三方数据集。
  • D.
    使用 Amazon Kinesis Data Streams 访问和集成来自 Amazon Elastic Container Registry (Amazon ECR) 的第三方数据集。

答案: A

本题的核心需求是快速整合第三方数据集,同时最小化集成的工作量、时间和运营成本。AWS Data Exchange是AWS专门推出的第三方数据集托管服务,用户可以直接在平台内搜索、订阅符合需求的合规第三方数据集,无需自行对接不同第三方的数据源、开发定制化的数据同步和校验逻辑,订阅完成后通过标准API即可直接访问数据并集成到现有分析平台,完全满足最低工作量、最低运营成本的要求。 各选项分析: A. 正确。AWS Data Exchange是AWS托管的第三方数据交易与分发服务,提供数千种来自合规第三方提供商的公开及商业数据集,用户订阅后直接通过API即可访问和集成数据,无需自行搭建数据对接基础设施,工作量和运营成本最低,完全匹配题目需求。 B. 错误。AWS DataSync是专用于大规模数据迁移的服务,用于在本地存储与AWS存储服务、不同AWS存储服务之间同步迁移数据,本身不提供第三方数据集访问能力,无法满足需求。 C. 错误。Amazon Kinesis Data Streams是实时流数据处理服务,用于采集、处理实时产生的流式数据;AWS CodeCommit是托管的Git代码存储库,用于存储代码等开发资产,无法存储和提供第三方业务数据集,两者均不匹配当前需求。 D. 错误。Amazon Elastic Container Registry是托管的容器镜像存储服务,仅用于存储、分发Docker容器镜像,不支持存储第三方业务数据集,Kinesis Data Streams也不适用静态第三方数据集的访问集成场景,因此错误。 关键知识点: 1. AWS Data Exchange核心功能:AWS托管的第三方数据集服务,支持用户快速订阅、访问、集成各类第三方商业和公开数据集,无需自行开发数据源对接逻辑,大幅降低数据集成工作量。 2. AWS数据服务场景选型:不同数据服务有明确的适用边界,DataSync用于数据迁移、Kinesis用于实时流处理、CodeCommit/ECR分别用于代码和容器镜像存储,不能跨场景混用。 3. 数据架构成本优化原则:集成第三方数据时优先选择托管的标准化服务,避免自行开发、运维定制化对接逻辑,降低运营成本和工作量。 参考资料: 1. What is AWS Data Exchange?, https://docs.aws.amazon.com/data-exchange/latest/userguide/what-is.html 2. AWS Certified Data Engineer - Associate (DEA-C01) Official Exam Guide, https://aws.amazon.com/certification/certified-data-engineer-associate/
DEA-C01 · Q4
Topic 1 Question #4 一家金融公司希望实施数据网格。该数据网格必须支持集中式数据治理、数据分析和数据访问控制。该公司已决定使用 AWS Glue 进行数据目录管理以及提取、转换和加载 (ETL) 操作。 以下哪两项 AWS 服务组合可以实现数据网格?
  • A.
    使用 Amazon Aurora 进行数据存储。使用 Amazon Redshift 预置集群进行数据分析。
  • B.
    使用 Amazon S3 进行数据存储。使用 Amazon Athena 进行数据分析。
  • C.
    使用 AWS Glue DataBrew 进行集中式数据治理和访问控制。
  • D.
    使用 Amazon RDS 进行数据存储。使用 Amazon EMR 进行数据分析。
  • E.
    使用 AWS Lake Formation 进行集中式数据治理和访问控制。

答案: BE

题目要求实现支持集中式数据治理、数据分析、数据访问控制的数据网格,且已经确定使用AWS Glue承担数据目录管理和ETL工作。正确选项B和E的组合可完全满足需求,其中Amazon S3作为可扩展、高耐久的统一对象存储,是AWS数据网格架构的标准存储底座,可支撑各数据域存储不同类型的海量数据,Amazon Athena作为无服务器交互式查询服务,原生对接AWS Glue数据目录,无需预置基础设施即可直接对S3上的多源数据执行即席分析,满足数据分析需求;而AWS Lake Formation原生集成AWS Glue数据目录,提供集中式的细粒度权限管理、数据分类、访问审计等治理能力,可实现题目要求的集中式数据治理和访问控制,二者配合已有的Glue服务,可完整搭建符合要求的数据网格。 各选项分析: A. 错误。Amazon Aurora是托管关系型数据库,适用于OLTP事务场景,无法作为数据网格的统一存储底座支撑多类型、多域的海量数据存储,且该选项未提供集中式数据治理和访问控制的实现方案,不符合需求。 B. 正确。Amazon S3是AWS构建数据湖和数据网格的标准存储层,具备无限扩展、高耐久、低成本的特性,支持存储结构化、半结构化、非结构化等各类数据域数据;Amazon Athena是无服务器的SQL查询服务,原生对接AWS Glue数据目录,无需预置基础设施即可直接查询S3上的数据,完全满足数据分析的需求。 C. 错误。AWS Glue DataBrew是可视化的无代码数据清理、转换和准备工具,核心功能是数据预处理,不具备集中式数据治理和访问控制的能力,不符合需求。 D. 错误。Amazon RDS是托管关系型数据库,仅适合存储结构化事务型数据,无法作为数据网格的统一存储底座支撑多类型海量数据存储,且该选项未提供集中式数据治理和访问控制的实现方案,不符合需求。 E. 正确。AWS Lake Formation是专门用于数据湖和数据网格治理的核心服务,原生集成AWS Glue数据目录,提供集中式的细粒度权限管控、数据分类、数据血缘、访问审计等能力,可直接实现题目要求的集中式数据治理和数据访问控制需求,与Glue、S3、Athena等服务无缝对接,是AWS数据网格架构的核心治理组件。 关键知识点: 1. AWS数据网格架构核心组成,以Amazon S3为统一存储底座,AWS Glue为元数据和ETL管理层,AWS Lake Formation为集中治理层,搭配Athena、Redshift等分析服务,实现分布式数据域自治和集中化治理的结合。 2. AWS Lake Formation核心功能,提供集中式数据访问控制、数据目录治理、数据安全管理等能力,是AWS实现数据湖和数据网格合规治理的核心服务。 3. Amazon Athena的适用场景,支持基于AWS Glue数据目录直接查询S3上的多源数据,无服务器架构无需运维,适合数据网格下跨域的即席数据分析需求。 参考资料: Implementing a data mesh on AWS, https://docs.aws.amazon.com/prescriptive-guidance/latest/patterns/implementing-a-data-mesh-on-aws.html What is AWS Lake Formation?, https://docs.aws.amazon.com/lake-formation/latest/dg/what-is-lake-formation.html
DEA-C01 · Q5
Topic 1 Question #5 一位数据工程师维护着一些自定义的 Python 脚本,这些脚本执行数据格式化流程,供许多 AWS Lambda 函数使用。当数据工程师需要修改这些 Python 脚本时,他必须手动更新所有 Lambda 函数。 数据工程师需要一种更便捷的 Lambda 函数更新方式。 哪种解决方案能够满足此需求?
  • A.
    将指向自定义 Python 脚本的指针存储在共享的 Amazon S3 存储桶的执行上下文对象中。
  • B.
    将自定义 Python 脚本打包成 Lambda 层。将 Lambda 层应用到 Lambda 函数。
  • C.
    将指向自定义 Python 脚本的指针存储在共享的 Amazon S3 存储桶的环境变量中。
  • D.
    为每个 Lambda 函数分配相同的别名。通过指定函数的别名来调用每个 Lambda 函数。

答案: B

本题考察AWS无服务器数据处理场景下的公共代码复用最佳实践,属于DEA-C01认证中Lambda运维优化的核心考点。题目场景中多个Lambda函数共享相同的Python格式化脚本,原有方案需要逐个更新所有Lambda的代码,运维成本高且易出错。选择Lambda层的方案完全匹配需求,Lambda层是AWS原生提供的公共代码共享组件,将公共Python脚本打包为层后,所有关联该层的Lambda函数都可以直接调用层中的代码,更新公共脚本时仅需发布新版本的层,再批量将关联Lambda切换到新层版本即可,无需逐个修改每个Lambda的业务代码,大幅降低更新运维成本,完全满足需求。 各选项分析: A. 错误。Lambda的执行上下文对象是函数运行时的临时对象,仅在单次函数执行周期内有效,无法持久化存储指向S3脚本的指针,且该方案需要额外开发从S3拉取脚本的逻辑,增加额外开销和故障风险,不符合AWS最佳实践。 B. 正确。Lambda层专为跨多个Lambda函数共享公共代码、依赖库设计,将公共Python脚本打包为层并关联到所有目标Lambda函数后,更新公共脚本仅需发布层的新版本,无需逐个修改每个Lambda的业务代码,完美解决题目中手动更新所有函数的痛点,是该场景的标准最优解。 C. 错误。将S3脚本路径存入环境变量的方案,需要为每个Lambda增加运行时从S3拉取脚本执行的逻辑,额外引入S3访问权限配置、网络开销、拉取失败容错等复杂度,且不符合Lambda代码部署的原生最佳实践,可靠性和可维护性远低于Lambda层方案。 D. 错误。Lambda别名是指向单个Lambda函数特定版本的指针,仅用于单函数的版本管理、灰度发布等场景,无法实现多个函数之间的公共代码共享,也无法解决公共脚本更新的问题,与题目需求完全无关。 关键知识点: 1. Lambda层核心功能:Lambda层是用于跨多个Lambda函数共享公共代码、依赖库、自定义运行时的无服务器资源,无需在每个函数的部署包中重复打包相同内容,有效减小部署包体积,降低重复运维成本。 2. Lambda层版本管理机制:Lambda层支持版本化控制,更新层内容时仅需发布新的层版本,关联的Lambda函数可按需切换到新版本层,无需修改函数自身的业务代码,大幅提升公共代码更新效率。 3. 无服务器数据处理代码复用最佳实践:对于多Lambda函数共享的公共数据处理逻辑,优先使用Lambda层实现,相比自行通过外部存储拉取代码的方案,具备性能更优、运维更简便、安全性更高的优势,是DEA-C01认证的高频考点。 参考资料: AWS Lambda 开发人员指南 - Lambda 层, https://docs.aws.amazon.com/lambda/latest/dg/configuration-layers.html AWS Certified Data Engineer - Associate (DEA-C01) 考试指南

常见问题

DEA-C01 有多少道练习题?

本题库收录 DEA-C01 练习题共 355 道,含单选、多选等题型,每题配有答案与解析。

DEA-C01 练习题支持中英文吗?

支持,DEA-C01 练习题为中英双语对照,便于对照原文理解。

DEA-C01 练习题可以免费试做吗?

可以,本页提供免费样题在线试做;完整题库可在掌学兔注册后获取。