Data Engineering with Databricks - French
Ce cours d'introduction constitue un point de départ approprié pour apprendre le Data Engineering avec Databricks.
Ci-dessous, nous décrivons chacun des quatre modules de quatre heures inclus dans ce cours.
Remarque : pour les quatre modules suivants, Databricks Academy adopte progressivement un format basé sur des notebooks pour les sessions en salle de classe au sein de l'environnement Databricks, abandonnant l'utilisation de diaporamas pour les cours. Vous pouvez accéder aux notebooks de cours dans l'environnement de lab Vocareum.
1. Data Ingestion with Lakeflow Connect
Ce cours offre une introduction complète à Lakeflow Connect, une solution évolutive et simplifiée pour ingérer des données dans Databricks à partir d'un large éventail de sources. Vous commencerez par explorer les différents types de connecteurs Lakeflow Connect (Standard et Managed) et découvrirez diverses techniques d'ingestion de données, notamment l'ingestion par batch, par batch incrémentiel et en streaming. Vous passerez également en revue les principaux avantages de l'utilisation de la Delta table et de l'architecture Medallion.
Ensuite, vous développerez des compétences pratiques pour ingérer des données depuis le cloud object storage à l'aide des Lakeflow Connect Standard Connectors. Cela inclut l'utilisation de méthodes telles que CREATE TABLE AS SELECT (CTAS), COPY INTO et Auto Loader, en mettant l'accent sur les avantages et les points à considérer de chaque approche. Vous apprendrez également à ajouter des colonnes de métadonnées à vos tables de niveau bronze lors de l'ingestion dans la Databricks Data Intelligence Platform. Le cours explique ensuite comment traiter les enregistrements qui ne correspondent pas au schema de votre table à l'aide de la colonne rescued data, ainsi que les stratégies de gestion et d'analyse de ces données. Vous explorerez aussi des techniques permettant d'ingérer et d'aplatir des données JSON semi-structurées.
Par la suite, vous découvrirez comment réaliser une ingestion de données de niveau entreprise à l'aide des Lakeflow Connect Managed Connectors afin d'importer des données depuis des bases de données et des applications Software-as-a-Service (SaaS). Le cours présente également Partner Connect comme une option pour intégrer des outils de partenaires à vos charges de travail d'ingestion.
Enfin, le cours se termine par des stratégies d'ingestion alternatives, notamment les opérations MERGE INTO et l'exploitation de Databricks Marketplace, vous dotant ainsi d'une base solide pour prendre en charge les cas d'usage modernes de data engineering.
2. Deploy Workloads with Lakeflow Jobs
Le cours Deploy Workloads with Lakeflow Jobs vous apprend à orchestrer et à automatiser les workflows de données, d'analytics et d'IA à l'aide de Lakeflow Jobs, une plateforme d'orchestration unifiée au sein de l'écosystème Databricks.
• Vous apprendrez à concevoir et à mettre en œuvre des charges de travail de données à l'aide de Directed Acyclic Graphs (DAGs), à configurer diverses options de planification et à implémenter des fonctionnalités de workflow avancées telles que l'exécution conditionnelle de tâches, les dépendances run-if et les boucles for each.
• Le cours couvre les bonnes pratiques pour créer des pipelines robustes et prêts pour la production, avec une sélection appropriée du compute, une orchestration modulaire, des techniques de gestion des erreurs et une conception tolérante aux pannes, le tout intégré nativement à la Databricks Data Intelligence Platform.
3. Build Data Pipelines with Apache Spark Declarative Pipelines
Ce cours présente aux utilisateurs les concepts et les compétences essentiels nécessaires à la création de pipelines de données à l'aide d'Apache Spark Declarative Pipelines (SDP) dans Databricks, pour l'ingestion et le traitement par batch incrémentiel ou en streaming via plusieurs streaming tables et materialized views. Conçu pour les data engineers qui débutent avec Spark Declarative Pipelines, le cours fournit une vue d'ensemble complète des composants principaux tels que le traitement incrémentiel des données, les streaming tables, les materialized views et les temporary views, en soulignant leurs objectifs spécifiques et leurs différences.
Les sujets abordés incluent :
• Le développement et le débogage de pipelines ETL avec l'éditeur multifichier de Spark Declarative Pipelines en SQL (des exemples de code Python sont fournis)
• La manière dont Spark Declarative Pipelines suit les dépendances de données dans un pipeline via le pipeline graph
• La configuration des ressources de compute du pipeline, des actifs de données, des modes de déclenchement et d'autres options avancées
Ensuite, le cours présente les data quality expectations dans Spark Declarative Pipelines et guide les utilisateurs tout au long du processus d'intégration des expectations aux pipelines afin de valider et de garantir l'intégrité des données. Les apprenants découvriront ensuite comment mettre un pipeline en production, y compris les options de planification, et comment activer la journalisation des événements du pipeline pour surveiller ses performances et son état de santé.
Enfin, le cours explique comment implémenter le Change Data Capture (CDC) à l'aide de la syntaxe AUTO CDC INTO dans Spark Declarative Pipelines pour gérer les slowly changing dimensions (SCD Type 1 et Type 2), préparant ainsi les utilisateurs à intégrer le CDC à leurs propres pipelines.
4. DevOps Essentials for Data Engineering
Ce cours explore les bonnes pratiques d'ingénierie logicielle et les principes DevOps, spécialement conçus pour les data engineers travaillant avec Databricks. Les participants acquerront une base solide sur des sujets clés tels que la qualité du code, le contrôle de version, la documentation et les tests. Le cours met l'accent sur le DevOps, en abordant ses composants principaux, ses avantages et le rôle de l'intégration et de la livraison continues (CI/CD) dans l'optimisation des workflows de data engineering.
Vous apprendrez à appliquer les principes de modularité dans PySpark afin de créer des composants réutilisables et de structurer le code de manière efficace. La pratique comprend la conception et la mise en œuvre de tests unitaires pour les fonctions PySpark à l'aide du framework pytest, suivies de tests d'intégration pour les pipelines de données Databricks avec Spark Declarative Pipeline et Jobs afin d'en garantir la fiabilité.
Le cours couvre également les opérations Git essentielles dans Databricks, y compris l'utilisation des Databricks Git Folders pour intégrer les pratiques d'intégration continue. Enfin, vous aurez un aperçu général des différentes méthodes de deployment des actifs Databricks, telles que REST API, CLI, SDK et Declarative Automation Bundles (DABs), ce qui vous permettra de maîtriser les techniques de déploiement et de gestion de vos pipelines.
À la fin du cours, vous maîtriserez les bonnes pratiques d'ingénierie logicielle et de DevOps, ce qui vous permettra de créer des solutions de data engineering évolutives, maintenables et efficaces.
Languages Available: English | 日本語 | Português BR | 한국어 | Español | française
1. Data Ingestion with Lakeflow Connect
• Compréhension de base de la Databricks Data Intelligence Platform, y compris les Databricks Workspaces, Apache Spark, Delta Lake, l'architecture Medallion et Unity Catalog.
• Compréhension de base des workflows d'ingestion de données (batch, streaming, incrémentiel) et des principes généraux de l'ETL.
• Expérience de l'utilisation de divers formats de fichiers (par exemple, Parquet, CSV, JSON, TXT).
• Maîtrise de SQL et de Python.
• Familiarité avec l'exécution de code dans les notebooks Databricks.
2. Deploy Workloads with Lakeflow Jobs
• Achèvement du cours « Get Started with Databricks for Data Engineering » ou une solide compréhension de la Databricks Data Intelligence Platform.
• Compréhension de base de sujets tels que la navigation dans un Databricks Workspace, Apache Spark, Delta Lake, l'architecture Medallion et Unity Catalog.
• Familiarité avec Python/PySpark.
• Expérience de la rédaction de requêtes SQL de niveau intermédiaire.
3. Build Data Pipelines with Apache Spark Declarative Pipelines
• Compréhension de base de la Databricks Data Intelligence Platform, y compris les Databricks Workspaces, Apache Spark, Delta Lake, l'architecture Medallion, Lakeflow Jobs et Unity Catalog.
• Expérience de l'ingestion de données brutes dans des Delta tables, y compris l'utilisation de la fonction SQL read_files pour charger des formats tels que CSV, JSON, TXT et Parquet.
• Maîtrise de la transformation des données à l'aide de SQL, y compris la rédaction de requêtes de niveau intermédiaire et une compréhension de base des jointures SQL.
• Compréhension des concepts de l'ETL et des workflows batch/streaming.
4. DevOps Essentials for Data Engineering
• Bonne connaissance de la plateforme Databricks, y compris une expérience des Databricks Workspaces, d'Apache Spark, de Delta Lake et de l'architecture Medallion, d'Unity Catalog, de Delta Live Tables et de Workflows. Une compréhension de base du contrôle de version Git est également requise.
• Expérience de l'ingestion et de la transformation de données, avec une maîtrise de PySpark pour le traitement des données et les manipulations de DataFrame. De plus, les candidats doivent avoir de l'expérience dans la rédaction de requêtes SQL de niveau intermédiaire pour l'analyse et la transformation des données.
• Connaissance de la programmation Python, avec une maîtrise de la rédaction de code Python de niveau intermédiaire, y compris la capacité à concevoir et à implémenter des fonctions et des classes. Les utilisateurs doivent également être compétents dans la création, l'importation et l'utilisation efficace de packages Python.
Outline
1. Data Ingestion with Lakeflow Connect
• Le Data Engineering dans Databricks
• Exploration de l'environnement de lab
• Ingestion de données depuis le cloud storage
• Démonstration - Ingestion de données avec CREATE TABLE AS et COPY INTO
• Démonstration - Créer des streaming tables en SQL à l'aide d'Auto Loader
• Ajout de colonnes de métadonnées lors de l'ingestion
• Démonstration - Ajouter des colonnes de métadonnées lors de l'ingestion
• Utilisation de la colonne Rescued Data
• Démonstration - Gérer l'ingestion de CSV avec la colonne Rescued Data
• Lab - Créer des Bronze tables à partir de fichiers CSV
• Ingestion de données semi-structurées : JSON
• Démonstration - Ingérer des fichiers JSON avec Databricks
• Lab - Créer des Bronze tables à partir de fichiers JSON
• Présentation de l'ingestion de données d'entreprise
• Démonstration - Ingestion de données d'entreprise avec LakeFlow Connect
• Fonctionnalités supplémentaires et ingestion dans des Delta Tables existantes
• Démonstration - BONUS - Ingestion de données avec MERGE INTO
2. Deploy Workloads with Lakeflow Jobs
• Introduction au Data Engineering dans Databricks
• Composants essentiels de Lakeflow Jobs
• Présentation du projet du cours
• Démonstration : Créer un job à l'aide de l'interface de Lakeflow Jobs
• Lab : Créez votre premier job
• Création et planification de jobs
• Démonstration : Automatiser les charges de travail avec la planification et les déclencheurs
• Tâche conditionnelle et itérative
• Démonstration : Créer des charges de travail dynamiques avec des tâches avancées
• Lab : Ajouter une tâche If-Else et automatiser votre job
• Gestion des échecs de tâches et surveillance des performances des jobs
• Démonstration : Surveiller et réparer une tâche
• Lakeflow Jobs en production et bonnes pratiques
• LAB BONUS : Orchestration modulaire
3. Build Data Pipelines with Apache Spark Declarative Pipelines
• Introduction au Data Engineering dans Databricks
• Démonstration : Configuration du cours et création d'un pipeline
• Présentation du projet du cours et des types de dataset
• Développement simplifié de pipelines et paramètres de pipeline courants
• Démonstration : Développer un pipeline simple
• Garantir la qualité des données avec les Expectations
• Démonstration : Ajouter des Expectations de qualité des données
• Lab : Créer un pipeline
• Streaming joins et deployment de pipelines en production
• Démonstration : Faire le deployment d'un pipeline en production
• Présentation du Change Data Capture (CDC)
• Démonstration : Change Data Capture avec AUTO CDC et SCD TYPE 1
• Lab bonus : AUTO CDC INTO avec SCD Type 1
4. DevOps Essentials for Data Engineering
Continuous Integration (CI)
• Introduction aux bonnes pratiques d'ingénierie logicielle (SWE)
• Introduction à la modularisation du code PySpark
• Démonstration : Modulariser le code PySpark - OBLIGATOIRE
• Lab : Modulariser le code PySpark
• Principes fondamentaux du DevOps
• Le rôle de CI et CD dans le DevOps
• Planification du projet
• Démonstration : Exploration de la configuration du projet
• Introduction aux tests unitaires pour PySpark
• Démonstration : Créer et exécuter des tests unitaires
• Lab : Créer et exécuter des tests unitaires
• Exécuter des tests d'intégration avec SDP et Jobs
• Démonstration : Réaliser des tests d'intégration
• Présentation du contrôle de version avec Git
• Lab : Contrôle de version avec Databricks Git Folders et GitHub
Continuous Deployment (CD)
• Présentation du deployment des actifs Databricks
• Démonstration : Faire le deployment des actifs Databricks
Public Class Registration
If your company has purchased success credits or has a learning subscription, please fill out the Training Request form. Otherwise, you can register below.
Private Class Request
If your company is interested in private training, please submit a request.
Registration options
Databricks has a delivery method for wherever you are on your learning journey
Self-Paced
Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos
Inscrivez-vous maintenantInstructor-Led
Public and private courses taught by expert instructors across half-day to two-day courses
Inscrivez-vous maintenantBlended Learning
Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase
Purchase nowSkills@Scale
Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

