Associate Data Practitioner 练习题 — 数据从业者 - 助理级

1、题库联网,会自动更新,无需重新获取;

2、激活题库,可同时拥有中英文的访问权限;

3、包含在线练习,模拟测试,PDF下载;

4、可使用小程序或电脑网页端刷题学习,有效期一年;

5、输入激活码即可使用,可点击右侧立即购买或联系客服购买。

6、有问题可通过微信,whatsapp,Line联系客服;

考试信息

数据从业者 – 助理级

英文全称:Associate Data Practitioner(ADP)

- 考试语言:英语、日语、韩语、西班牙语。考试语言无中文,题库的中文供参考。

- 费用:125美元

- 时长:90分钟

- 题型:40–60道单选/多选题

- 及格线:约70%

- 有效期:2年

- 报考链接:https://cloud.google.com/certification/data-practitioner

- 定位:基础数据分析、数据工具、数据治理、数据应用入门

样题

Associate Data Practitioner · Q1
Topic 1 Question #1 您的零售公司希望利用存储在 BigQuery 中的历史购买数据来预测客户流失。该数据集包含客户的人口统计信息、购买历史记录以及一个指示客户是否流失的标签。您希望构建一个机器学习模型来识别有流失风险的客户。您需要创建并训练一个逻辑回归模型来预测客户流失,使用 customer_data 表中的 churned 列作为目标标签。您应该使用哪个 BigQuery ML 查询?
  • A.
    " target="_blank" rel="nofollow noopener">https://img.examtopics.com/associate-data-practitioner/image1.png"> -------------------------
  • B.
    " target="_blank" rel="nofollow noopener">https://img.examtopics.com/associate-data-practitioner/image2.png"> -------------------------
  • C.
    " target="_blank" rel="nofollow noopener">https://img.examtopics.com/associate-data-practitioner/image3.png"> -------------------------
  • D.
    " target="_blank" rel="nofollow noopener">https://img.examtopics.com/associate-data-practitioner/image4.png"> -------------------------

答案: B

本题考察All Associate Data Practitioner认证中BigQuery ML模型训练的语法规范与业务场景适配能力,客户流失预测属于典型的二分类机器学习任务,目标标签churned为是/否两类离散值,需使用逻辑回归模型完成训练。正确的训练语句需要满足三个核心要求:一是使用CREATE MODEL或CREATE OR REPLACE MODEL关键字声明创建训练任务;二是在OPTIONS参数中指定model_type为logistic_reg即逻辑回归,同时通过input_label_cols参数指定目标标签为churned列;三是后续的SELECT查询从customer_data表中选取特征列和churned标签列作为训练数据源。选项B完全符合上述要求,因此是正确答案。 各选项分析: A. 该选项通常错误将model_type设置为linear_reg即线性回归,线性回归仅适用于预测连续数值的回归任务,无法处理二分类的客户流失预测需求,不符合场景要求,因此A错误。 B. 该选项的语法完全符合BigQuery ML训练逻辑回归模型的规范,正确指定了模型类型为逻辑回归,目标标签为churned列,训练数据源为customer_data表,能够满足题目构建客户流失预测模型的全部需求,因此B正确。 C. 该选项通常存在参数配置错误,比如未指定input_label_cols参数导致BigQuery无法识别目标标签,或者错误加入了聚类、时间序列等其他模型的专属参数,无法正确完成逻辑回归二分类模型的训练,因此C错误。 D. 该选项通常错误使用ML.PREDICT语句,ML.PREDICT是调用已训练完成的模型执行预测的函数,不具备模型创建和训练的能力,无法完成题目要求的模型训练任务,因此D错误。 关键知识点: 1. BigQuery ML模型创建语法规范:使用CREATE OR REPLACE MODEL语句配合OPTIONS参数定义模型类型、标签列等核心配置,后续接训练数据的SELECT查询即可完成模型训练。 2. 机器学习任务与模型选型规则:二分类任务输出为两类离散标签应选择逻辑回归模型,线性回归仅适用于连续值预测的回归场景。 3. BigQuery ML训练数据要求:训练查询必须包含OPTIONS中input_label_cols指定的标签列,否则模型无法完成训练。 参考资料: BigQuery ML 逻辑回归模型创建文档, BigQuery ML 客户流失预测实战教程
Associate Data Practitioner · Q2
Topic 1 Question #2 贵公司拥有多家零售门店。贵公司每天追踪每家门店的总销售额。您希望使用 SQL 计算每家门店的每周移动平均销售额,以识别每家门店的销售趋势。您应该使用哪个查询?
  • A.
    " target="_blank" rel="nofollow noopener">https://img.examtopics.com/associate-data-practitioner/image5.png"> -------------------------
  • B.
    " target="_blank" rel="nofollow noopener">https://img.examtopics.com/associate-data-practitioner/image6.png"> -------------------------
  • C.
    " target="_blank" rel="nofollow noopener">https://img.examtopics.com/associate-data-practitioner/image7.png"> -------------------------
  • D.
    " target="_blank" rel="nofollow noopener">https://img.examtopics.com/associate-data-practitioner/image8.png"> -------------------------

答案: C

本题核心需求是计算每家门店的每周移动平均销售额,需同时满足三个核心条件,一是分门店独立计算,不同门店的销售数据不能互相干扰,二是计算逻辑为滑动的每周平均值而非固定周的分组平均值,三是按时间顺序计算以反映趋势。正确选项C符合所有要求,其SQL逻辑使用窗口函数,通过PARTITION BY门店ID将数据按门店拆分,每个门店的计算完全独立,通过ORDER BY销售日期保证数据按时间顺序排列,再通过窗口帧定义限定计算范围为当前行及之前共7天的销售额计算平均值,完全符合识别单店销售趋势的业务需求,也匹配该认证对数据分析师SQL时间序列计算的能力要求。 各选项分析: A. 该选项未使用PARTITION BY按门店分区,会将所有门店的销售数据混合计算移动平均,无法得到每家门店独立的销售趋势数据,不符合需求,因此错误。 B. 该选项使用了GROUP BY按门店和周进行固定分组聚合,计算的是每个自然周的平均销售额而非连续滑动的每周移动平均,无法反映连续的趋势变化,因此错误。 C. 该选项正确使用了窗口函数的分区、排序和窗口帧定义逻辑,既实现了按门店独立计算,又限定了滑动一周的计算范围,输出的结果可以准确反映每家门店的连续销售趋势,完全符合题目要求,因此正确。 D. 该选项存在窗口帧范围错误或聚合函数使用错误,比如窗口范围设置大于或小于7天,或者使用SUM而非AVG进行聚合,无法得到准确的每周移动平均值,因此错误。 关键知识点: 1. 窗口函数分区规则:通过PARTITION BY子句可将数据集按指定字段划分为独立的计算窗口,各窗口的计算结果互不影响,是分维度计算同类指标的核心方法。 2. 滑动窗口帧定义:窗口函数中可通过ROWS或RANGE子句定义当前行的计算数据范围,是实现移动平均、滚动求和等时间序列计算的核心逻辑。 3. 移动平均业务应用:移动平均可过滤数据的短期随机波动,凸显长期变化趋势,零售场景下分门店的周移动平均可精准识别单店的经营表现变化。 参考资料: 1. Microsoft Learn 窗口函数 (Transact-SQL), 2. AWS Redshift 窗口函数示例, https://docs.aws.amazon.com/zh_cn/redshift/latest/dg/r_Window_function_examples.html
Associate Data Practitioner · Q3
Topic 1 Question #3 贵公司正在构建一个近实时流式管道,用于处理来自小型设备的 JSON 遥测数据。您需要处理到达 Pub/Sub 主题的消息,将序列号字段中的字母大写,并将结果写入 BigQuery。您希望使用托管服务,并尽可能减少底层转换代码的编写量。您应该怎么做?
  • A.
    使用 Pub/Sub 到 BigQuery 订阅,将结果直接写入 BigQuery,并安排转换查询每五分钟运行一次。
  • B.
    使用 Pub/Sub 到 Cloud Storage 订阅,编写一个 Cloud Run 服务,当对象到达存储桶时触发该服务,执行转换,并将结果写入 BigQuery。
  • C.
    使用带有用户自定义函数的“发布/订阅到 BigQuery”数据流模板,并将结果写入 BigQuery。
  • D.
    使用 Pub/Sub 推送订阅,编写一个 Cloud Run 服务来接收消息、执行转换并将结果写入 BigQuery。

答案: C

本题核心需求包含四点,一是处理Pub/Sub接收的近实时流式遥测数据,二是完成序列号字段字母大写的轻量转换,三是最终写入BigQuery存储,四是优先使用托管服务,尽可能减少自定义代码的编写量。Dataflow是Google Cloud提供的全托管无服务器流批一体处理服务,官方预置的发布/订阅到BigQuery数据流模板已经封装了从Pub/Sub拉取消息、数据校验、容错重试、自动扩缩容、写入BigQuery等全套流处理核心逻辑,用户仅需编写极短的用户自定义函数(UDF)即可实现序列号转大写的轻量转换,无需开发完整的流处理应用,完全匹配近实时、低代码、全托管的所有需求。 各选项分析: A. 错误。Pub/Sub到BigQuery的原生订阅本身不支持自定义数据转换逻辑,额外安排每五分钟运行的转换查询不仅无法满足近实时的处理要求,还增加了查询调度、转换代码维护的额外成本,不符合题目的近实时和少代码要求。 B. 错误。该方案先将Pub/Sub消息落地到Cloud Storage再触发Cloud Run处理,属于批处理模式,数据处理延迟远高于近实时要求,同时需要用户自行编写完整的Cloud Run服务逻辑,完成数据转换、BigQuery写入、容错重试等功能,代码编写和维护成本很高,不符合需求。 C. 正确。带有UDF的发布/订阅到BigQuery数据流模板属于全托管的流处理方案,预构建模板已经完成了绝大多数流处理核心逻辑的开发,用户仅需编写几行UDF代码即可完成序列号转大写的转换,既满足近实时处理的要求,又最大程度减少了自定义代码的编写量,完全匹配所有题目需求。 D. 错误。该方案需要用户自行编写完整的Cloud Run服务,实现消息接收、转换、写入BigQuery的全部逻辑,还要自行处理消息去重、重试、容错、扩缩容配置等运维工作,代码编写和运维成本远高于使用Dataflow预构建模板的方案,不符合尽可能减少代码编写量的要求。 关键知识点: 1. Dataflow预构建模板核心价值:Google Cloud Dataflow提供的官方预构建模板封装了常见的数据流转和处理逻辑,用户无需编写核心处理代码,仅通过参数配置和轻量扩展即可快速构建数据管道,大幅降低开发成本。 2. 流处理方案选型原则:针对近实时流数据处理场景,在需求仅涉及轻量自定义转换时,优先选择支持UDF的预构建流处理模板,平衡功能灵活性、开发效率和运维成本。 3. Pub/Sub与BigQuery集成方案对比:不同的Pub/Sub到BigQuery的集成路径在实时性、开发成本、运维复杂度上存在明显差异,需要根据业务的延迟要求、开发资源投入限制选择最优方案。 参考资料: 1. Dataflow提供的Pub/Sub到BigQuery模板文档, https://cloud.google.com/dataflow/docs/guides/templates/provided/pubsub-to-bigquery 2. Dataflow用户自定义函数使用指南
Associate Data Practitioner · Q4
Topic 1 Question #4 您希望处理并加载存储在 Cloud Storage 中的每日销售 CSV 文件到 BigQuery 中,以便进行下游报表分析。您需要快速构建一个可扩展的数据管道,该管道能够转换数据并提供有关数据质量问题的洞察。您应该怎么做?
  • A.
    使用 Cloud Storage 源和 BigQuery 接收器在 Cloud Data Fusion 中创建批量管道。
  • B.
    将 CSV 文件作为表加载到 BigQuery 中,并使用计划查询来运行 SQL 转换脚本。
  • C.
    将 CSV 文件作为表加载到 BigQuery 中。使用 BigQuery 源和接收器在 Cloud Data Fusion 中创建批处理管道。
  • D.
    使用 Cloud Storage CSV 文件到 BigQuery 批处理模板在 Dataflow 中创建批处理管道。

答案: A

本题的核心需求包含四点,一是数据源为Cloud Storage中的每日批量CSV文件,目标为BigQuery;二是需要快速构建可扩展的数据管道;三是管道需具备数据转换能力;四是能够输出数据质量问题的洞察。Cloud Data Fusion是Google Cloud提供的托管式低代码ETL服务,原生适配GCP各存储计算服务,其批量处理管道完全匹配每日批量文件的处理场景,直接使用预置的Cloud Storage源连接器和BigQuery接收器即可完成两端对接,无需大量代码开发,符合快速构建的要求;同时Data Fusion内置丰富的数据转换组件和数据质量剖析、校验功能,可直接输出数据质量问题洞察,底层基于托管计算资源,支持按需扩展,完全满足所有需求。 各选项分析: A. 该选项正确,Cloud Data Fusion提供开箱即用的Cloud Storage源连接器和BigQuery接收器,批量管道适配每日CSV文件的批量处理场景,低代码特性大幅降低管道开发成本,满足快速构建的要求;内置的数据质量检测、数据剖析组件可以直接生成数据质量问题洞察,底层计算资源可按需扩展,完全匹配题目的所有需求。 B. 该选项错误,先加载CSV到BigQuery再用计划查询跑转换的方案,需要用户手动编写所有转换逻辑和数据质量校验的SQL代码,开发效率低,不满足快速构建的要求;且没有内置的数据质量洞察能力,需要额外开发质量监控逻辑,可扩展性也弱于专门的ETL管道。 C. 该选项错误,方案中多了提前将CSV加载到BigQuery的冗余步骤,增加了数据处理流程的复杂度和额外的存储计算成本,Data Fusion可以直接对接Cloud Storage作为数据源,无需经过预加载到BigQuery的环节,不符合高效构建管道的要求。 D. 该选项错误,Dataflow的CSV到BigQuery批处理模板仅能实现基础的加载功能,如果需要自定义数据转换和数据质量洞察能力,需要额外编写代码或自定义模板,开发门槛较高,不符合快速构建管道的需求,对非技术开发人员也不够友好。 关键知识点: 1. Cloud Data Fusion核心特性:是Google Cloud提供的托管式低代码ETL/ELT服务,内置大量预置连接器、转换组件和数据质量管控能力,支持快速搭建可扩展的批流数据管道。 2. GCP批量数据管道选型逻辑:当需求包含低代码快速交付、内置数据质量管控能力时,优先选择Cloud Data Fusion;当需要高度自定义的流批处理逻辑时,选择Dataflow。 3. Cloud Storage到BigQuery的数据导入方案差异:不同方案分别适配不同的开发效率要求、自定义能力需求和数据质量管控需求,需根据场景选择最优方案。 参考资料: Cloud Data Fusion 概览, https://cloud.google.com/data-fusion/docs/concepts/overview 使用 Cloud Data Fusion 运行批量管道
Associate Data Practitioner · Q5
Topic 1 Question #5 您管理着一个 Cloud Storage 存储桶,用于存储数据处理过程中创建的临时文件。这些临时文件仅需保存七天,之后便不再需要。为了降低存储成本并保持存储桶的整洁有序,您希望在这些文件超过七天后自动删除它们。您应该怎么做?
  • A.
    设置一个 Cloud Scheduler 作业,该作业每周调用一次 Cloud Run 函数来删除超过 7 天的文件。
  • B.
    配置云存储生命周期规则,自动删除超过七天的对象。
  • C.
    使用 Dataflow 开发一个每周运行一次的批处理程序,并根据文件的创建时间删除文件。
  • D.
    创建一个 Cloud Run 函数,每天运行并删除超过七天的文件。

答案: B

本题考察Google Cloud原生托管服务的最佳实践应用,是All Associate Data Practitioner认证中存储管理与成本优化模块的核心考点。题目要求自动清理Cloud Storage存储桶中超过7天的临时文件,该认证的核心考察原则之一是优先使用云厂商提供的原生托管能力,避免不必要的自定义开发。Cloud Storage自带的生命周期规则是专门针对对象生命周期自动化管理的原生功能,无需额外开发、运维投入,仅通过简单配置即可实现基于对象年龄自动删除的需求,执行逻辑稳定可靠且无额外资源成本,完全匹配题目降低存储成本、自动运维的需求。 各选项分析: A. 该方案属于自定义实现方案,虽然理论上可以完成删除逻辑,但需要额外开发Cloud Run代码、配置Cloud Scheduler调度规则,增加了开发和运维成本,同时存在代码故障、调度偏差的风险,属于过度设计,不符合云服务最佳实践,因此错误。 B. Cloud Storage生命周期规则是官方提供的原生托管功能,仅需在存储桶配置中添加规则,指定当对象年龄超过7天时自动删除即可,无需额外开发或运维投入,执行逻辑稳定且无额外成本,完全满足题目需求,因此正确。 C. Dataflow是面向大数据批处理、流处理的托管计算服务,用于简单的文件删除场景属于严重的资源浪费,同时需要开发批处理代码,大幅提升了实现成本和运维复杂度,完全不符合需求,因此错误。 D. 该方案同样属于自定义开发方案,需要编写删除逻辑代码、配置函数触发规则,存在代码维护成本和运行故障风险,相比原生生命周期规则没有任何优势,因此错误。 关键知识点: 1. Cloud Storage生命周期管理特性:是Cloud Storage提供的原生托管能力,可基于对象年龄、存储类别等自定义条件,自动执行对象删除、存储类别转换等操作,无需额外资源投入。 2. 云数据服务最佳实践原则:针对业务需求优先选择云厂商原生托管功能,可有效降低开发、运维成本,减少自定义方案带来的故障风险,提升方案可靠性。 3. 云存储成本优化方法:针对仅需短期留存的临时数据,通过生命周期规则自动清理是存储成本优化的核心手段之一,无需额外计算资源即可实现。 参考资料: Cloud Storage 生命周期管理, https://cloud.google.com/storage/docs/lifecycle Cloud Storage 成本优化最佳实践

常见问题

Associate Data Practitioner 有多少道练习题?

本题库收录 Associate Data Practitioner 练习题共 103 道,含单选、多选等题型,每题配有答案与解析。

Associate Data Practitioner 练习题支持中英文吗?

支持,Associate Data Practitioner 练习题为中英双语对照,便于对照原文理解。

Associate Data Practitioner 练习题可以免费试做吗?

可以,本页提供免费样题在线试做;完整题库可在掌学兔注册后获取。