Skip to main content

Machine Learning at Scale - Mandarin Chinese

在本课程中,您将深入了解 Apache Spark 的架构及其在 Databricks 中应用于机器学习工作负载的理论与实践知识。您将学习何时使用 Spark 进行数据准备、模型训练和部署,同时获得使用 Spark ML 以及 Pandas APIs on Spark 的实践经验。本课程将向您介绍高级概念,例如超参数调优以及使用 Spark 扩展 Optuna。本课程将使用助理课程中介绍的功能和概念,例如 MLflow 和 Unity Catalog,以实现全面的模型打包与治理。


注意: 对于 SCORM 讲授文件,请确保在完成内容后关闭 SCORM 窗口。请勿点击“Next Lesson”按钮,否则可能导致 SCORM 模块无法被标记为已完成。

Skill Level
Professional
Duration
2h
Prerequisites

本课程内容面向具备以下技能、知识和能力的学员:

• 熟悉 Databricks Data Intelligence Platform 及基本工作区运营(创建集群、在笔记本中运行代码、使用基本笔记本操作、从 Git 导入 Repos)

• 具备中级 Python 编程经验,包括数据处理库(Pandas、NumPy)和机器学习框架(Scikit-Learn)

• 掌握 Apache Spark 和 PySpark 基础知识,包括 DataFrames、转换及分布式数据处理操作

• 理解机器学习概念,包括模型训练、评估、超参数调优及部署工作流

• 具备中级 Delta Lake 运营经验(创建表、执行更新、优化文件、时间旅行功能)

• 基本熟悉 MLflow 的实验追踪、模型记录及 Model Registry 运营

• 理解分布式计算概念(集群架构、并行化、可扩展性考量)

• 掌握基本 SQL 知识,用于在 Spark 环境中进行数据查询与处理

Self-Paced

Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos

See all our registration options

Registration options

Databricks has a delivery method for wherever you are on your learning journey

Runtime

Self-Paced

Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos

Register now

Instructors

Instructor-Led

Public and private courses taught by expert instructors across half-day to two-day courses

Register now

Learning

Blended Learning

Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase

Purchase now

Scale

Skills@Scale

Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

Upcoming Public Classes

Data Engineer

Build Data Pipelines with Apache Spark Declarative Pipelines - Mandarin Chinese

本课程向用户介绍使用 Databricks 中的 Apache Spark™ Declarative Pipelines (SDP) 构建数据管道所需的基本概念和技能,涵盖通过多个流式处理表和物化视图进行增量批处理或流式处理摄取与处理。本课程专为初次接触 Spark Declarative Pipelines 的数据工程师设计,全面介绍核心组件,包括增量数据处理、流式处理表、物化视图和临时视图,并重点说明其各自的用途与区别。

课程涵盖以下主题:

• 使用 Spark Declarative Pipelines 中的多文件编辑器,通过 SQL 开发和调试 ETL 管道(并提供 Python 代码示例)

• Spark Declarative Pipelines 如何通过管道图形跟踪管道中的数据依赖关系

• 配置管道 compute 资源、数据资产、触发器模式及其他高级选项

随后,课程介绍 Spark Declarative Pipelines 中的数据质量期望,引导用户将期望集成到管道中,以验证和强制执行数据完整性。学员还将浏览如何将管道投入生产,包括调度选项,以及启用管道事件日志记录以监控管道性能和健康状况。

最后,课程介绍如何在 Spark Declarative Pipelines 中使用 AUTO CDC INTO 语法实现变更数据捕获 (CDC),以管理缓慢变化维度(SCD Type 1 和 Type 2),帮助用户将 CDC 集成到自己的管道中。

注意:对于 SCORM 课程文件,请确保完成内容后关闭 SCORM 窗口。请勿点击‘Next Lesson’按钮,否则可能会导致 SCORM 模块无法标记为已完成。

Free
2h
Associate

Questions?

If you have any questions, please refer to our Frequently Asked Questions page.