Topic 1 Question #1
您的零售公司希望利用存储在 BigQuery 中的历史购买数据来预测客户流失。该数据集包含客户的人口统计信息、购买历史记录以及一个指示客户是否流失的标签。您希望构建一个机器学习模型来识别有流失风险的客户。您需要创建并训练一个逻辑回归模型来预测客户流失,使用 customer_data 表中的 churned 列作为目标标签。您应该使用哪个 BigQuery ML 查询?
答案: B
本题考察All Associate Data Practitioner认证中BigQuery ML模型训练的语法规范与业务场景适配能力,客户流失预测属于典型的二分类机器学习任务,目标标签churned为是/否两类离散值,需使用逻辑回归模型完成训练。正确的训练语句需要满足三个核心要求:一是使用CREATE MODEL或CREATE OR REPLACE MODEL关键字声明创建训练任务;二是在OPTIONS参数中指定model_type为logistic_reg即逻辑回归,同时通过input_label_cols参数指定目标标签为churned列;三是后续的SELECT查询从customer_data表中选取特征列和churned标签列作为训练数据源。选项B完全符合上述要求,因此是正确答案。 各选项分析:
A. 该选项通常错误将model_type设置为linear_reg即线性回归,线性回归仅适用于预测连续数值的回归任务,无法处理二分类的客户流失预测需求,不符合场景要求,因此A错误。
B. 该选项的语法完全符合BigQuery ML训练逻辑回归模型的规范,正确指定了模型类型为逻辑回归,目标标签为churned列,训练数据源为customer_data表,能够满足题目构建客户流失预测模型的全部需求,因此B正确。
C. 该选项通常存在参数配置错误,比如未指定input_label_cols参数导致BigQuery无法识别目标标签,或者错误加入了聚类、时间序列等其他模型的专属参数,无法正确完成逻辑回归二分类模型的训练,因此C错误。
D. 该选项通常错误使用ML.PREDICT语句,ML.PREDICT是调用已训练完成的模型执行预测的函数,不具备模型创建和训练的能力,无法完成题目要求的模型训练任务,因此D错误。 关键知识点:
1. BigQuery ML模型创建语法规范:使用CREATE OR REPLACE MODEL语句配合OPTIONS参数定义模型类型、标签列等核心配置,后续接训练数据的SELECT查询即可完成模型训练。
2. 机器学习任务与模型选型规则:二分类任务输出为两类离散标签应选择逻辑回归模型,线性回归仅适用于连续值预测的回归场景。
3. BigQuery ML训练数据要求:训练查询必须包含OPTIONS中input_label_cols指定的标签列,否则模型无法完成训练。 参考资料:
BigQuery ML 逻辑回归模型创建文档, BigQuery ML 客户流失预测实战教程