DP-700 练习题 — DP-700:使用 Microsoft Fabric 实现数据工程解决方案

1、题库联网,会自动更新,无需重新获取;

2、语言为中英文,包含在线练习,模拟测试,PDF下载;

3、可使用小程序,电脑网页端刷题学习,有效期一年;

4、激活码可直接购买,或通过天猫旗舰店购买;

5、有问题可通过微信,whatsapp,Line联系客服;

6、拖拽题,热点题,下拉框题正在逐步实现。

样题

DP-700 · Q1
Topic 1 Question #1 案例研究 - 这是一项案例研究。案例研究不单独计时。您可以根据需要使用任意数量的考试时间来完成每个案例。但是,本次考试可能包含额外的案例研究和部分内容。您必须合理安排时间,确保能够在规定时间内完成本次考试的所有问题。 要回答案例研究中的问题,您需要参考案例研究中提供的信息。案例研究可能包含图表和其他资源,以提供有关案例研究中所述场景的更多信息。本案例研究中的每个问题都是独立的。 案例研究结束后,将出现一个复习页面。您可以在此页面上查看答案并进行修改,然后再进入考试的下一部分。一旦开始新的部分,您将无法返回到本部分。 开始案例研究 - 要显示本案例研究中的第一个问题,请单击“下一步”按钮。在回答问题之前,请使用左侧窗格中的按钮浏览案例研究的内容。 单击这些按钮将显示诸如业务需求、现有环境和问题陈述等信息。如果案例研究包含“所有信息”选项卡,请注意,其中显示的信息与后续选项卡中显示的信息相同。准备好回答问题后,单击“问题”按钮返回问题页面。 概述。公司概述 - Contoso, Ltd. 是一家在线零售公司,希望通过迁移到 Fabric 来实现其分析平台的现代化。该公司计划开始使用 Fabric 进行市场营销分析。 概述。IT 架构 - 该公司的 IT 部门拥有一支数据分析师团队和一支数据工程师团队,他们使用分析系统。 数据工程师负责数据的摄取、转换和加载。他们倾向于使用 Python 或 SQL 来转换数据。 数据分析师负责查询数据并创建语义模型和报告。他们具备使用 Power Query 和 T-SQL 编写查询的资质。 现有环境。Fabric - Contoso 拥有一个名为 Cap1 的 F64 容量。所有 Fabric 用户都可以创建项目。Contoso 有两个工作区,分别名为 WorkspaceA 和 WorkspaceB,目前使用 Pro 许可模式。 现有环境。源系统 Contoso 拥有一个名为 POS1 的销售点 (POS) 系统,该系统使用 Azure 虚拟机上的 SQL Server 实例,与 Fabric 位于同一 Microsoft Entra 租户中。主机虚拟机位于一个私有虚拟网络中,该网络已阻止公共访问。POS1 包含公司网站上处理的所有销售交易。 该公司还有一个名为 MAR1 的软件即服务 (SaaS) 在线营销应用程序。MAR1 包含七个实体。这些实体包含与电子邮件打开率、互动率以及网站互动相关的数据。可以通过调用 REST API 从 MAR1 导出数据。每个实体都有不同的端点。Contoso 已使用 MAR1 一年。往年的数据以 Parquet 文件的形式存储在 Amazon Simple Storage Service (Amazon S3) 存储桶中。共有 12 个文件,大小从 300 MB 到 900 MB 不等,与电子邮件互动相关。 现有环境。产品数据: POS1 包含产品列表和相关数据。数据来自以下三个表: 产品表、 产品类别表和 产品子类别表。 数据中,产品与产品子类别关联,子类别又与产品类别关联。 现有环境:Azure - Contoso 拥有一个 Microsoft Entra 租户,其中包含以下启用邮件功能的安全组: 数据分析师组:包含数据分析师 ;数据工程师组:包含数据工程师 。Contoso 拥有 Azure 订阅。 该公司已有一个 Azure DevOps 组织,并创建了一个新项目,用于存放与 Fabric 相关的存储库。 现有环境。用户问题: Contoso 的市场营销副总裁需要分析不同类型电子邮件内容的有效性。通常需要一周时间来手动编译和分析数据。Contoso 希望通过使用 Fabric 将时间缩短到一天以内。 数据工程团队已成功从 MAR1 导出数据。但团队遇到了短暂的连接错误,导致数据导出失败。 需求。计划变更 - Contoso 计划创建以下两个湖屋: 湖屋 1:将存储来自源的原始数据和清洗后的数据; 湖屋 2:将以维度模型的形式向用户提供数据,用于分析查询 。此外,还将添加其他功能以方便数据摄取和转换。Contoso 计划在 Fabric 中使用 Azure Repos 进行源代码控制。 要求。技术要求 新的湖屋必须遵循勋章架构,采用以下三个层级:青铜层、白银层和黄金层。白银层需要进行大量的数据清理工作,才能填充 MAR1 数据,包括去重、处理缺失值和规范化大小写。 每一层都必须完全填充完毕才能进行下一层。如果填充湖屋的任何步骤失败,必须向数据工程师发送电子邮件。 数据导入应尽可能同时进行。 使用来自 Amazon S3 存储桶的电子邮件数据必须满足以下要求: 最大限度地降低跨云数据访问相关的出站流量成本; 防止在湖屋中保存原始数据的副本。 与数据摄取相关的项目必须满足以下要求: 这些项目必须与其他工作区项目一起进行源代码控制。 摄取的数据必须以 Delta 格式进入 Lakehouse1 的青铜层。 在数据进入青铜层之前,除了文件格式的更改之外,不得进行任何其他更改。 必须最大限度地减少开发工作量,并且必须使用内置连接导入源数据。 如果出现连接错误,导入过程必须尝试重新连接。Lakehouse 、数据管道和笔记本必须存储在 WorkspaceA 中。语义模型、报告和数据流必须存储在 WorkspaceB 中。 每周必须删除 Delta 表日志中不再引用的旧文件。 要求。数据转换: 在 POS1 产品数据中,ProductID 值是唯一的。黄金层中的产品维度必须仅包含产品列表中的活动产品。活动产品由 IsActive 值为 1 标识。 某些产品类别和子类别未分配给任何产品。它们与分析无关,必须从黄金层中的产品维度中省略。 要求。数据安全 - Fabric 中的安全性必须满足以下要求: 数据工程师必须拥有对所有 Lakehouse(包括底层文件)的读写权限。 数据分析师必须仅拥有对黄金层中 Delta 表的读取权限。 数据分析师绝对不能访问青铜层和白银层的数据。 数据工程师必须能够在 WorkspaceA 中将更改提交到源代码控制系统。 您需要确保数据分析师可以访问黄金层的 lakehouse。 你应该怎么做?
  • A.
    将 DataAnalyst 组添加到 WorkspaceA 的 Viewer 角色。
  • B.
    与数据分析师组共享 lakehouse,并授予其构建默认语义模型报告的权限。
  • C.
    与数据分析师组共享湖畔小屋,并授予读取所有 SQL 端点数据的权限。
  • D.
    与数据分析师组共享湖畔小屋,并授予读取所有 Apache Spark 权限。

答案: C

本题核心需求是数据分析师仅能访问湖屋黄金层的Delta表,完全禁止访问青铜、白银层数据,同时数据分析师的技术栈为T-SQL和Power Query。选项C授予读取所有SQL端点数据的权限,恰好匹配需求:Fabric湖屋的SQL端点支持精细化的表级权限控制,可配置为仅开放黄金层Delta表的读取权限,既符合安全隔离要求,又适配分析师使用T-SQL查询的使用习惯,完全满足所有业务和安全规则。 各选项分析: A. 错误,WorkspaceA的Viewer角色是粗粒度的工作区全域权限,会授予用户查看工作区内所有内容的权限,包括湖屋青铜、白银层的文件和表,直接违反了数据分析师不得访问青铜、白银层的安全要求。 B. 错误,授予构建默认语义模型报告的权限仅支持分析师基于预定义语义模型创建报告,无法满足分析师直接查询黄金层Delta表的需求,且该权限无法实现层级别的访问隔离,不符合要求。 C. 正确,湖屋的SQL端点是面向SQL用户的标准化查询接口,支持表级、行级精细化权限配置,可精准限制仅开放黄金层Delta表的读取权限,既适配分析师使用T-SQL查询的技术栈,又严格隔离了青铜、白银层的非公开数据,完全符合所有要求。 D. 错误,授予Apache Spark权限要求用户使用Spark框架访问数据,而数据分析师不具备Spark使用能力,且Spark权限默认可访问湖屋所有层的底层文件,无法实现层级安全隔离,不符合要求。 关键知识点: 1. Microsoft Fabric湖屋的多接口权限控制,湖屋支持SQL端点、Spark、文件浏览器三种访问方式,每种方式对应独立的权限配置逻辑,可适配不同角色的使用需求。 2. Fabric工作区角色与对象级权限的差异,工作区角色是粗粒度的全域权限,对象级权限可针对单个湖屋、单个表配置精细化访问权限,适用于多角色数据隔离场景。 3. Fabric勋章架构的安全规范,青铜、白银为数据加工层仅对数据工程师开放,黄金为业务访问层仅对分析用户开放,需通过权限控制实现层级隔离。 参考资料: Control access to lakehouses in Microsoft Fabric, Workspace roles in Microsoft Fabric
DP-700 · Q2
Topic 1 Question #2 你有一个 Fabric 工作区, 其中包含半结构化数据。 你需要使用 T-SQL、KQL 和 Apache Spark 读取数据,但数据只能通过 Spark 写入。 你应该使用什么来存储数据?
  • A.
    湖边小屋
  • B.
    活动中心
  • C.
    数据集市
  • D.
    仓库

答案: A

本题有四个核心约束条件,分别是支持半结构化数据存储、支持T-SQL读取、支持KQL读取、仅允许Spark执行写入操作。微软Fabric中的湖边小屋(Lakehouse)是湖仓一体架构的原生存储组件,底层托管在OneLake上,天然适配半结构化数据存储需求,其提供的只读SQL端点可满足T-SQL读取需求,绑定KQL查询集后可支持KQL读取,同时支持Spark池直接访问存储层读写数据,且默认非Spark的访问路径仅开放读取权限,完全匹配所有需求,因此选择A选项。 各选项分析: A. 湖边小屋:正确。该组件支持存储半结构化数据,可通过SQL端点用T-SQL读取、通过KQL查询集用KQL读取、通过Spark池读写数据,且默认仅Spark可执行写入操作,完全符合题目所有要求。 B. 活动中心:错误。活动中心是Fabric中用于实时流数据引入和分析的组件,主要面向时序、流数据场景,不适合作为半结构化数据的通用存储,且支持KQL直接写入,不符合仅Spark可写入的要求。 C. 数据集市:错误。数据集市是面向特定业务部门的结构化数据分析存储,对半结构化数据支持有限,且支持T-SQL执行写入操作,不符合仅Spark可写入的要求。 D. 仓库:错误。Fabric的数据仓库是面向结构化数据的企业级分析存储,半结构化数据支持能力弱,且原生支持T-SQL读写,不符合仅Spark可写入的要求。 关键知识点: 1. Fabric Lakehouse访问特性:Lakehouse基于OneLake构建,支持多类型数据存储,提供只读T-SQL端点、KQL查询集访问、Spark读写三种访问方式,默认仅Spark可执行写入操作。 2. Fabric存储组件能力差异:Fabric中不同存储组件的适配场景、支持的查询语言、写入权限存在明确差异,是DP-700考试的核心考点。 3. Fabric半结构化数据存储方案:半结构化数据的存储首选Lakehouse,可兼容多种查询语言的访问需求。 参考资料: 微软Fabric湖边小屋概述, https://learn.microsoft.com/zh-cn/fabric/data-engineering/lakehouse-overview 查询Fabric湖边小屋
DP-700 · Q3
Topic 1 Question #3 您有一个 Fabric 工作区,其中包含一个名为 Warehouse1 的仓库。 您还有一个名为 Database1 的本地 Microsoft SQL Server 数据库,该数据库通过本地数据网关访问。 您需要将数据从 Database1 复制到 Warehouse1。 您应该使用哪个项目?
  • A.
    第一代数据流
  • B.
    数据管道
  • C.
    KQL 查询集
  • D.
    一本笔记本

答案: B

本题需求是将本地SQL Server数据库的数据复制到Microsoft Fabric的仓库中,核心是实现跨本地与云环境的批量数据迁移,属于DP-700认证中Fabric数据集成工具选型的核心考点。Microsoft Fabric的数据管道是专门面向数据集成场景的原生工具,支持通过本地数据网关安全访问未公网暴露的本地SQL Server数据源,可通过内置复制活动高效完成全量或增量数据同步到Fabric仓库,无需编写复杂代码,是完成该需求的最优方案。 各选项分析: A. 第一代数据流:第一代数据流核心能力是数据准备与转换,主要用于数据清洗、加工场景,并非专门用于跨源批量数据复制任务,其对本地数据网关的批量复制支持能力弱于数据管道,无法高效匹配本题纯数据复制的需求,因此错误。 B. 数据管道:Fabric数据管道属于数据工厂工作负载,专门用于构建数据集成工作流,原生支持配置复制活动,可通过本地数据网关对接本地SQL Server,直接将数据同步到Warehouse1,完全符合题目所有需求,因此正确。 C. KQL 查询集:KQL查询集是针对Fabric实时分析数据库(Kusto数据库)的查询分析工具,仅支持使用Kusto查询语言处理Kusto数据库内的数据,无法实现跨数据源的复制操作,也不能直接对接本地SQL Server完成数据迁移,因此错误。 D. 一本笔记本:Fabric笔记本基于Spark运行,适用于高级数据处理、数据分析、数据科学等需要自定义编码的场景,虽然理论上可通过编写代码实现数据复制,但操作复杂度高、运维成本高,并非官方推荐的标准数据复制方案,因此错误。 关键知识点: 1. Microsoft Fabric数据管道的核心功能:数据管道是Fabric中完成跨数据源集成、数据复制、数据同步任务的核心工具,支持对接多种本地和云数据源,可实现低代码的自动化数据传输工作流,是DP-700考察的重点数据集成工具。 2. 本地数据网关的作用:本地数据网关用于在本地数据源和Microsoft云服务之间建立安全加密连接,Fabric的各类数据集成工具均可通过该网关访问未暴露在公网的本地数据源,是混合场景数据传输的核心依赖。 3. Fabric工作负载的功能边界:需明确数据管道、数据流、KQL查询集、笔记本的不同适用场景,根据业务需求选择最适配的工具,是DP-700中资源选型类题目的核心考察点。 参考资料: 在 Microsoft Fabric 中使用复制活动复制数据, https://learn.microsoft.com/zh-cn/fabric/data-factory/copy-data-activity Microsoft Fabric 本地数据网关概述
DP-700 · Q4
Topic 1 Question #4 您有一个 Fabric 工作区,其中包含一个名为 Warehouse1 的仓库。 您还有一个名为 Database1 的本地 Microsoft SQL Server 数据库,该数据库通过本地数据网关访问。 您需要将数据从 Database1 复制到 Warehouse1。 您应该使用哪个项目?
  • A.
    Apache Spark 作业定义
  • B.
    数据管道
  • C.
    第一代数据流
  • D.
    事件流

答案: B

题目要求将通过本地数据网关访问的本地SQL Server数据库数据复制到Fabric的仓库中,属于典型的跨环境批量数据迁移场景。DP-700认证核心考点包含Fabric数据集成工具的选型规则,其中数据管道是Fabric数据工厂模块的核心组件,专门用于批量数据集成与迁移,天然支持通过本地数据网关对接本地SQL Server数据源,无需复杂代码即可通过内置复制活动完成数据到Warehouse1的同步,完全匹配题目需求。 各选项分析: A. Apache Spark作业定义是Fabric中用于运行自定义Spark代码开展大数据转换、复杂计算的组件,适用于需要自定义逻辑的数据处理场景,并非用于简单批量数据复制的工具,实现题述需求需要额外编写代码,不是最优选择,因此错误。 B. 数据管道是Fabric数据工厂提供的低代码数据集成工具,内置复制活动,支持通过本地数据网关连接本地SQL Server等本地数据源,可直接将数据批量同步到Fabric仓库,完全满足题目的数据复制需求,因此正确。 C. 第一代数据流主要用于Power BI场景下的自助式数据准备,输出目标通常为Power BI数据集或Dataverse,不支持直接将数据同步到Fabric仓库,且不是批量数据迁移的首选工具,因此错误。 D. 事件流是Fabric中用于处理实时流数据的组件,适用于IoT数据、消息队列数据等实时数据的采集与处理,题述场景为静态批量数据复制,不属于实时流处理场景,因此错误。 关键知识点: 1. Microsoft Fabric数据管道的核心能力:数据管道是Fabric数据工厂的核心组件,支持低代码实现批量数据迁移、数据任务调度,可对接本地、云等多类数据源,适配跨环境数据同步需求。 2. Fabric数据工具选型规则:不同工具适配不同场景,批量数据迁移选数据管道,自定义大数据处理选Spark作业,实时数据处理选事件流,自助式数据准备选数据流。 3. 本地数据网关的适配范围:本地数据网关可配合Fabric数据管道等组件,打通Fabric云服务与本地数据源的访问链路,实现本地数据到Fabric的安全同步。 参考资料: Microsoft Fabric 数据管道概述, https://learn.microsoft.com/zh-cn/fabric/data-factory/pipeline-overview 使用复制活动复制数据, https://learn.microsoft.com/zh-cn/fabric/data-factory/copy-data-activity
DP-700 · Q5
Topic 1 Question #5 您有一个 Fabric F32 容量,其中包含一个工作区。该工作区包含一个名为 DW1 的仓库,该仓库使用 MD5 哈希代理键进行建模。DW1 包含一个事实表,该表在过去一年中从 2 亿行增长到 5 亿行。 您有基于 Direct Lake 的 Microsoft Power BI 报表。这些报表显示的是同比数据。 用户报告称,随着时间的推移,部分报表的性能有所下降,并且某些可视化效果出现错误。 您需要解决这些性能问题。解决方案必须满足以下要求: 提供最佳查询性能; 最大限度地降低运营成本。 您应该怎么做?
  • A.
    将 MD5 哈希值更改为 SHA256。
  • B.
    提高产能。
  • C.
    启用 V-Order。
  • D.
    修改代理键,使其使用不同的数据类型。
  • E.
    创建视图。

答案: B

本题属于DP-700认证中Microsoft Fabric容量管理和Direct Lake性能优化的考点,当前环境使用F32容量,事实表数据量从2亿行增长到5亿行,同比查询需要扫描大量历史数据,现有F32容量的计算、内存资源已经无法支撑当前负载,导致查询性能下降甚至超时引发可视化错误。提高产能即升级Fabric容量SKU,可以直接提升可用的计算和内存资源,无需修改现有数据模型、ETL流程和Power BI报表,改造成本极低,同时能快速获得最优的查询性能,完全满足题目中最佳查询性能和最小化运营成本的要求。 各选项分析: A. 将MD5哈希值更改为SHA256,SHA256生成的哈希值长度远大于MD5,会增加存储开销和关联查询的计算成本,不仅无法提升性能,反而会进一步降低查询效率,因此A错误。 B. 提高产能也就是升级Fabric的容量SKU,可直接扩容工作区可用的计算、内存资源,能够支撑5亿行级表的Direct Lake同比查询负载,无需修改现有业务逻辑,运营投入最低,同时能直接获取最佳查询性能,完全符合题目要求,因此B正确。 C. 启用V-Order是通过优化Parquet文件的存储排序来提升部分查询性能,无法解决当前容量资源不足的核心瓶颈,且需要重写整个事实表的存储文件,改造成本远高于升级容量,无法满足最小化运营成本的要求,因此C错误。 D. 修改代理键的数据类型属于全量重构数据模型,需要重新加工5亿行事实表和所有关联维度表,还要验证修改后的ETL流程和Power BI报表逻辑,运营改造成本极高,不符合最小化运营成本的要求,因此D错误。 E. 创建视图只是对查询逻辑的封装,不会改变底层查询的计算开销,无法解决容量资源不足导致的性能下降和查询超时错误,因此E错误。 关键知识点: 1. Microsoft Fabric容量SKU特性,不同F系列SKU对应不同的计算、内存资源配额,当数据量和查询负载上涨超过现有容量配额时,会出现查询性能下降、超时错误等问题。 2. Direct Lake模式性能影响因素,Fabric容量的资源配额是影响大表查询性能的核心因素之一,负载上涨时优先匹配对应容量资源是成本最低的优化方案。 3. Fabric性能优化成本优先级,无侵入的容量升级方案相比数据模型重构、存储重写等方案,运营改造成本更低,适合快速解决资源不足导致的性能问题。 参考资料: Microsoft Fabric 许可证和容量 SKU, https://learn.microsoft.com/zh-cn/fabric/enterprise/licenses#capacity-skus Direct Lake 性能优化指南

常见问题

DP-700 有多少道练习题?

本题库收录 DP-700 练习题共 139 道,含单选、多选等题型,每题配有答案与解析。

DP-700 练习题支持中英文吗?

支持,DP-700 练习题为中英双语对照,便于对照原文理解。

DP-700 练习题可以免费试做吗?

可以,本页提供免费样题在线试做;完整题库可在掌学兔注册后获取。