Data Preparation for Machine Learning - Mandarin Chinese
本课程专注于使用 Databricks 为机器学习准备数据的基础知识。学员将学习探索、清洗和整理数据的核心技能,这些技能专为传统机器学习应用而设计。主要主题包括数据可视化、特征工程以及最优特征存储策略。通过实践练习 ,学员将获得在 Databricks 中高效准备机器学习数据集的实操经验。本课程面向初级数据科学家、机器学习从业者,以及希望提升数据准备能力的人员,旨在为成功部署机器学习模型奠定坚实基础。
注意:
- 这是 'Machine Learning with Databricks’ 系列课程中的第一门课程。
- 对于 SCORM 课程文件,请确保完成内容后关闭 SCORM 窗口。请勿点击 ‘Next Lesson’ 按钮,否则可能导致 SCORM 模块无法标记为已完成。
在尝试学习此内容之前,您至少应熟悉以下内容:
• 已完成"Databricks 机器学习入门(引导)"课程,或具备同等水平的 Databricks 环境使用基础知识。
- 学员应熟悉 Databricks 工作区的导航操作、笔记本的创建与运行,以及 Databricks 上基本机器学习工作流的相关知识。本课程以此为基础,重点介绍机器学习的数据准备工作。
• 具备中级 Python 编程能力,能够用于数据准备与分析。
- 学员应能熟练使用 Pandas、NumPy 和 scikit-learn 等库进行数据处理、缺失值处理以及基本特征转换。
• 具备机器学习基础知识。
- 包括熟悉训练集与测试集、特征工程以及模型开发流水线等概念。
• 熟悉 Databricks 平台工作流。
- 学员应能完成基本操作,例如创建集群、在笔记本中运行代码,以及使用常见的笔记本运营功能。
• 具备数据格式与湖仓概念的基础知识。
- 学员应熟悉 CSV、JSON 和 Parquet 等常见数据格式,并对 Delta Lake 及湖仓架构有初步了解。
• 具备探索性数据分析与基础统计学的基本认识。
- 包括了解数据分布、缺失值、异常值,以及用于评估数据质量的简单数据可视化技术。
Self-Paced
Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos
Registration options
Databricks has a delivery method for wherever you are on your learning journey
Self-Paced
Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos
Register nowInstructor-Led
Public and private courses taught by expert instructors across half-day to two-day courses
Register nowBlended Learning
Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase
Purchase nowSkills@Scale
Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

