Revenir au contenu principal

Data Engineering with Databricks - French

Ce cours d'introduction constitue un point de départ approprié pour apprendre le Data Engineering avec Databricks.

Ci-dessous, nous décrivons chacun des quatre modules de quatre heures inclus dans ce cours.


Remarque : pour les quatre modules suivants, Databricks Academy adopte progressivement un format basé sur des notebooks pour les sessions en salle de classe au sein de l'environnement Databricks, abandonnant l'utilisation de diaporamas pour les cours. Vous pouvez accéder aux notebooks de cours dans l'environnement de lab Vocareum.


1. Data Ingestion with Lakeflow Connect

Ce cours offre une introduction complète à Lakeflow Connect, une solution évolutive et simplifiée pour ingérer des données dans Databricks à partir d'un large éventail de sources. Vous commencerez par explorer les différents types de connecteurs Lakeflow Connect (Standard et Managed) et découvrirez diverses techniques d'ingestion de données, notamment l'ingestion par batch, par batch incrémentiel et en streaming. Vous passerez également en revue les principaux avantages de l'utilisation de la Delta table et de l'architecture Medallion.


Ensuite, vous développerez des compétences pratiques pour ingérer des données depuis le cloud object storage à l'aide des Lakeflow Connect Standard Connectors. Cela inclut l'utilisation de méthodes telles que CREATE TABLE AS SELECT (CTAS), COPY INTO et Auto Loader, en mettant l'accent sur les avantages et les points à considérer de chaque approche. Vous apprendrez également à ajouter des colonnes de métadonnées à vos tables de niveau bronze lors de l'ingestion dans la Databricks Data Intelligence Platform. Le cours explique ensuite comment traiter les enregistrements qui ne correspondent pas au schema de votre table à l'aide de la colonne rescued data, ainsi que les stratégies de gestion et d'analyse de ces données. Vous explorerez aussi des techniques permettant d'ingérer et d'aplatir des données JSON semi-structurées.


Par la suite, vous découvrirez comment réaliser une ingestion de données de niveau entreprise à l'aide des Lakeflow Connect Managed Connectors afin d'importer des données depuis des bases de données et des applications Software-as-a-Service (SaaS). Le cours présente également Partner Connect comme une option pour intégrer des outils de partenaires à vos charges de travail d'ingestion.


Enfin, le cours se termine par des stratégies d'ingestion alternatives, notamment les opérations MERGE INTO et l'exploitation de Databricks Marketplace, vous dotant ainsi d'une base solide pour prendre en charge les cas d'usage modernes de data engineering.


2. Deploy Workloads with Lakeflow Jobs

Le cours Deploy Workloads with Lakeflow Jobs vous apprend à orchestrer et à automatiser les workflows de données, d'analytics et d'IA à l'aide de Lakeflow Jobs, une plateforme d'orchestration unifiée au sein de l'écosystème Databricks.


Vous apprendrez à concevoir et à mettre en œuvre des charges de travail de données à l'aide de Directed Acyclic Graphs (DAGs), à configurer diverses options de planification et à implémenter des fonctionnalités de workflow avancées telles que l'exécution conditionnelle de tâches, les dépendances run-if et les boucles for each.

Le cours couvre les bonnes pratiques pour créer des pipelines robustes et prêts pour la production, avec une sélection appropriée du compute, une orchestration modulaire, des techniques de gestion des erreurs et une conception tolérante aux pannes, le tout intégré nativement à la Databricks Data Intelligence Platform.


3. Build Data Pipelines with Apache Spark Declarative Pipelines

Ce cours présente aux utilisateurs les concepts et les compétences essentiels nécessaires à la création de pipelines de données à l'aide d'Apache Spark Declarative Pipelines (SDP) dans Databricks, pour l'ingestion et le traitement par batch incrémentiel ou en streaming via plusieurs streaming tables et materialized views. Conçu pour les data engineers qui débutent avec Spark Declarative Pipelines, le cours fournit une vue d'ensemble complète des composants principaux tels que le traitement incrémentiel des données, les streaming tables, les materialized views et les temporary views, en soulignant leurs objectifs spécifiques et leurs différences.


Les sujets abordés incluent :

Le développement et le débogage de pipelines ETL avec l'éditeur multifichier de Spark Declarative Pipelines en SQL (des exemples de code Python sont fournis)

La manière dont Spark Declarative Pipelines suit les dépendances de données dans un pipeline via le pipeline graph

La configuration des ressources de compute du pipeline, des actifs de données, des modes de déclenchement et d'autres options avancées


Ensuite, le cours présente les data quality expectations dans Spark Declarative Pipelines et guide les utilisateurs tout au long du processus d'intégration des expectations aux pipelines afin de valider et de garantir l'intégrité des données. Les apprenants découvriront ensuite comment mettre un pipeline en production, y compris les options de planification, et comment activer la journalisation des événements du pipeline pour surveiller ses performances et son état de santé.


Enfin, le cours explique comment implémenter le Change Data Capture (CDC) à l'aide de la syntaxe AUTO CDC INTO dans Spark Declarative Pipelines pour gérer les slowly changing dimensions (SCD Type 1 et Type 2), préparant ainsi les utilisateurs à intégrer le CDC à leurs propres pipelines.


4. DevOps Essentials for Data Engineering

Ce cours explore les bonnes pratiques d'ingénierie logicielle et les principes DevOps, spécialement conçus pour les data engineers travaillant avec Databricks. Les participants acquerront une base solide sur des sujets clés tels que la qualité du code, le contrôle de version, la documentation et les tests. Le cours met l'accent sur le DevOps, en abordant ses composants principaux, ses avantages et le rôle de l'intégration et de la livraison continues (CI/CD) dans l'optimisation des workflows de data engineering.


Vous apprendrez à appliquer les principes de modularité dans PySpark afin de créer des composants réutilisables et de structurer le code de manière efficace. La pratique comprend la conception et la mise en œuvre de tests unitaires pour les fonctions PySpark à l'aide du framework pytest, suivies de tests d'intégration pour les pipelines de données Databricks avec Spark Declarative Pipeline et Jobs afin d'en garantir la fiabilité.


Le cours couvre également les opérations Git essentielles dans Databricks, y compris l'utilisation des Databricks Git Folders pour intégrer les pratiques d'intégration continue. Enfin, vous aurez un aperçu général des différentes méthodes de deployment des actifs Databricks, telles que REST API, CLI, SDK et Declarative Automation Bundles (DABs), ce qui vous permettra de maîtriser les techniques de déploiement et de gestion de vos pipelines.


À la fin du cours, vous maîtriserez les bonnes pratiques d'ingénierie logicielle et de DevOps, ce qui vous permettra de créer des solutions de data engineering évolutives, maintenables et efficaces.


Languages Available: English | 日本語 | Português BR | 한국어 | Español | française

Skill Level
Associate
Duration
16h
Prerequisites

1. Data Ingestion with Lakeflow Connect

Compréhension de base de la Databricks Data Intelligence Platform, y compris les Databricks Workspaces, Apache Spark, Delta Lake, l'architecture Medallion et Unity Catalog.

Compréhension de base des workflows d'ingestion de données (batch, streaming, incrémentiel) et des principes généraux de l'ETL.

Expérience de l'utilisation de divers formats de fichiers (par exemple, Parquet, CSV, JSON, TXT).

Maîtrise de SQL et de Python.

Familiarité avec l'exécution de code dans les notebooks Databricks.


2. Deploy Workloads with Lakeflow Jobs

Achèvement du cours « Get Started with Databricks for Data Engineering » ou une solide compréhension de la Databricks Data Intelligence Platform.

Compréhension de base de sujets tels que la navigation dans un Databricks Workspace, Apache Spark, Delta Lake, l'architecture Medallion et Unity Catalog.

Familiarité avec Python/PySpark.

Expérience de la rédaction de requêtes SQL de niveau intermédiaire.


3. Build Data Pipelines with Apache Spark Declarative Pipelines

Compréhension de base de la Databricks Data Intelligence Platform, y compris les Databricks Workspaces, Apache Spark, Delta Lake, l'architecture Medallion, Lakeflow Jobs et Unity Catalog.

Expérience de l'ingestion de données brutes dans des Delta tables, y compris l'utilisation de la fonction SQL read_files pour charger des formats tels que CSV, JSON, TXT et Parquet.

Maîtrise de la transformation des données à l'aide de SQL, y compris la rédaction de requêtes de niveau intermédiaire et une compréhension de base des jointures SQL.

Compréhension des concepts de l'ETL et des workflows batch/streaming.


4. DevOps Essentials for Data Engineering

Bonne connaissance de la plateforme Databricks, y compris une expérience des Databricks Workspaces, d'Apache Spark, de Delta Lake et de l'architecture Medallion, d'Unity Catalog, de Delta Live Tables et de Workflows. Une compréhension de base du contrôle de version Git est également requise.

Expérience de l'ingestion et de la transformation de données, avec une maîtrise de PySpark pour le traitement des données et les manipulations de DataFrame. De plus, les candidats doivent avoir de l'expérience dans la rédaction de requêtes SQL de niveau intermédiaire pour l'analyse et la transformation des données.

Connaissance de la programmation Python, avec une maîtrise de la rédaction de code Python de niveau intermédiaire, y compris la capacité à concevoir et à implémenter des fonctions et des classes. Les utilisateurs doivent également être compétents dans la création, l'importation et l'utilisation efficace de packages Python.

Outline

1. Data Ingestion with Lakeflow Connect

 Le Data Engineering dans Databricks

 Exploration de l'environnement de lab

 Ingestion de données depuis le cloud storage

 Démonstration - Ingestion de données avec CREATE TABLE AS et COPY INTO

 Démonstration - Créer des streaming tables en SQL à l'aide d'Auto Loader

 Ajout de colonnes de métadonnées lors de l'ingestion

 Démonstration - Ajouter des colonnes de métadonnées lors de l'ingestion

 Utilisation de la colonne Rescued Data

 Démonstration - Gérer l'ingestion de CSV avec la colonne Rescued Data

 Lab - Créer des Bronze tables à partir de fichiers CSV

 Ingestion de données semi-structurées : JSON

 Démonstration - Ingérer des fichiers JSON avec Databricks

 Lab - Créer des Bronze tables à partir de fichiers JSON

 Présentation de l'ingestion de données d'entreprise

 Démonstration - Ingestion de données d'entreprise avec LakeFlow Connect

 Fonctionnalités supplémentaires et ingestion dans des Delta Tables existantes

 Démonstration - BONUS - Ingestion de données avec MERGE INTO


2. Deploy Workloads with Lakeflow Jobs

 Introduction au Data Engineering dans Databricks

 Composants essentiels de Lakeflow Jobs

 Présentation du projet du cours

 Démonstration : Créer un job à l'aide de l'interface de Lakeflow Jobs

 Lab : Créez votre premier job

 Création et planification de jobs

 Démonstration : Automatiser les charges de travail avec la planification et les déclencheurs

 Tâche conditionnelle et itérative

 Démonstration : Créer des charges de travail dynamiques avec des tâches avancées

 Lab : Ajouter une tâche If-Else et automatiser votre job

 Gestion des échecs de tâches et surveillance des performances des jobs

 Démonstration : Surveiller et réparer une tâche

 Lakeflow Jobs en production et bonnes pratiques

 LAB BONUS : Orchestration modulaire


3. Build Data Pipelines with Apache Spark Declarative Pipelines

 Introduction au Data Engineering dans Databricks

 Démonstration : Configuration du cours et création d'un pipeline

 Présentation du projet du cours et des types de dataset

 Développement simplifié de pipelines et paramètres de pipeline courants

 Démonstration : Développer un pipeline simple

 Garantir la qualité des données avec les Expectations

 Démonstration : Ajouter des Expectations de qualité des données

 Lab : Créer un pipeline

 Streaming joins et deployment de pipelines en production

 Démonstration : Faire le deployment d'un pipeline en production

 Présentation du Change Data Capture (CDC)

 Démonstration : Change Data Capture avec AUTO CDC et SCD TYPE 1

 Lab bonus : AUTO CDC INTO avec SCD Type 1


4. DevOps Essentials for Data Engineering

Continuous Integration (CI)

 Introduction aux bonnes pratiques d'ingénierie logicielle (SWE)

 Introduction à la modularisation du code PySpark

 Démonstration : Modulariser le code PySpark - OBLIGATOIRE

 Lab : Modulariser le code PySpark

 Principes fondamentaux du DevOps

 Le rôle de CI et CD dans le DevOps

Planification du projet

Démonstration : Exploration de la configuration du projet

Introduction aux tests unitaires pour PySpark

Démonstration : Créer et exécuter des tests unitaires

Lab : Créer et exécuter des tests unitaires

Exécuter des tests d'intégration avec SDP et Jobs

Démonstration : Réaliser des tests d'intégration

Présentation du contrôle de version avec Git

Lab : Contrôle de version avec Databricks Git Folders et GitHub

Continuous Deployment (CD)

Présentation du deployment des actifs Databricks

Démonstration : Faire le deployment des actifs Databricks

Public Class Registration

If your company has purchased success credits or has a learning subscription, please fill out the Training Request form. Otherwise, you can register below.

Private Class Request

If your company is interested in private training, please submit a request.

See all our registration options

Registration options

Databricks has a delivery method for wherever you are on your learning journey

Runtime

Self-Paced

Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos

Inscrivez-vous maintenant

Instructors

Instructor-Led

Public and private courses taught by expert instructors across half-day to two-day courses

Inscrivez-vous maintenant

Learning

Blended Learning

Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase

Purchase now

Scale

Skills@Scale

Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

Upcoming Public Classes

Apache Spark Programming with Databricks - French

Ce cours d'introduction constitue un point de départ approprié pour apprendre le Data Engineering avec Databricks.

Ci-dessous, nous décrivons chacun des quatre modules de quatre heures inclus dans ce cours.

Remarque : pour les quatre modules suivants, Databricks Academy adopte progressivement un format basé sur des notebooks pour les sessions en salle de classe au sein de l'environnement Databricks, abandonnant l'utilisation de diaporamas pour les cours. Vous pouvez accéder aux notebooks de cours dans l'environnement de lab Vocareum.

Introduction to Apache Spark

Ce cours accessible aux débutants couvre les fondamentaux d'Apache Spark pour le traitement de données à grande échelle. Vous explorerez l'architecture distribuée de Spark, maîtriserez l'API DataFrame et apprendrez à lire, écrire et traiter des données avec Python. Grâce à des exercices pratiques, vous développerez les compétences nécessaires pour exécuter efficacement des transformations et des actions Spark.

Developing Applications with Apache Spark

Maîtrisez le traitement de données à grande échelle avec Apache Spark dans ce cours. Apprenez à construire des pipelines ETL efficaces, à effectuer des analyses de données avancées et à optimiser les transformations de données distribuées à l'aide de l'API DataFrame de Spark. Explorez le regroupement, l'agrégation, les jointures, les opérations sur les ensembles et les fonctions de fenêtrage. Travaillez avec des types de données complexes tels que les tableaux, les maps et les structs, tout en appliquant les meilleures pratiques d'optimisation des performances.

Stream Processing and Analysis with Apache Spark

Ce cours guide les apprenants sur la manière de développer des applications de traitement de stream évolutives et tolérantes aux pannes en utilisant l'API Spark Structured Streaming sur Databricks.

Monitoring and Optimizing Apache Spark Workloads on Databricks

Ce cours couvre les composants essentiels de la plateforme Databricks et Apache Spark avec Delta Lake, en mettant l'accent sur l'architecture Lakehouse, Unity Catalog et les techniques de Gestion des données telles que les Transactions ACID et la maintenance des tables. De plus, il enseigne aux étudiants comment Optimiser la performance des requêtes grâce au partitionnement, aux shuffles et aux outils de réglage, tout en utilisant le Spark UI pour surveiller les applications et résoudre les goulots d'étranglement.

Languages Available: English | 日本語 | 한국어

Paid
16h
Lab
instructor-led
Associate

Questions?

If you have any questions, please refer to our Frequently Asked Questions page.