Build Data Pipelines with Apache Spark Declarative Pipelines - French
Ce cours présente aux utilisateurs les concepts essentiels et les compétences nécessaires pour construire des pipelines de données à l'aide d'Apache Spark™ Pipeline déclaratifs (SDP) dans Databricks pour l'ingestion et le traitement incrémentaux en batch ou en streaming à travers plusieurs tables streaming et vues matérialisées. Conçu pour les ingénieurs de données qui débutent avec Spark Pipeline déclaratifs, le cours offre une vue d'ensemble complète des composants fondamentaux tels que le traitement incrémental des données, les tables streaming, les vues matérialisées et les vues temporaires, en mettant en évidence leurs objectifs spécifiques et leurs différences.
Les sujets abordés comprennent :
• Le développement et le débogage de pipelines ETL avec l'éditeur multi-fichiers dans Spark Pipeline déclaratifs en utilisant SQL (avec des exemples de code Python fournis)
• La façon dont Spark Pipeline déclaratifs suit les dépendances des données dans un pipeline à travers le graphique du pipeline
• La configuration des ressources compute du pipeline, des actifs de données, des modes de déclencheur et d'autres options avancées
Ensuite, le cours présente les attentes en matière de qualité des données dans Spark Pipeline déclaratifs, guidant les utilisateurs à travers le processus d'intégration des attentes dans les pipelines pour valider et appliquer l'Intégrité des données. Les apprenants exploreront ensuite comment mettre un pipeline en production, notamment les options de planification, et l'activation de la journalisation des événements du pipeline pour surveiller la performance et l'état du pipeline.
Enfin, le cours explique comment implémenter le Change Data Capture (CDC) à l'aide de la syntaxe AUTO CDC INTO dans Spark Pipeline déclaratifs pour gérer les slowly changing dimensions (SCD Type 1 et Type 2), préparant ainsi les utilisateurs à intégrer le CDC dans leurs propres pipelines.
Remarque : Databricks Academy adopte progressivement un format basé sur des notebooks pour les sessions en salle de classe au sein de l'environnement Databricks, abandonnant l'utilisation de diaporamas pour les cours. Vous pouvez accéder aux notebooks de cours dans l'environnement de lab Vocareum.
Dans ce cours, le contenu a été conçu pour des participants possédant les compétences/connaissances/aptitudes suivantes :
• Compréhension de base de la Databricks Data Intelligence platform, notamment les Espaces de travail Databricks, Apache Spark, Delta Lake, la Medallion Architecture, les Lakeflow jobs et Unity Catalog.
• Expérience dans l'ingestion de Données brutes dans des tables Delta, notamment l'utilisation de la fonction SQL read_files pour charger des formats tels que CSV, JSON, TXT et Parquet.
• Maîtrise de la transformation des données à l'aide de SQL, notamment la rédaction de requêtes de niveau intermédiaire et une compréhension de base des jointures SQL.
• Compréhension des concepts ETL et des Workflows batch/streaming.
Outline
• Introduction au data engineering dans Databricks
• Démo - Configuration du cours et création d'un Pipeline
• Présentation du projet de cours et des types d'ensembles de données
• Développement simplifié de Pipeline et paramètres courants de Pipeline
• Demo - Developing a Simple Pipeline
• Garantir la qualité des données avec les Expectations
• Démo - Ajout d'attentes en matière de qualité des données
• Lab - Create a Pipeline
• Streaming Joins et déploiement de pipelines en production
• Démo - Déploiement d'un pipeline en production
• Change Data Capture (CDC) Overview
• Démo - Change Data Capture avec AUTO CDC avec SCD TYPE 1
• Résumé et Étapes Suivantes
• Bonus Lab - AUTO CDC INTO with SCD Type 1
Public Class Registration
If your company has purchased success credits or has a learning subscription, please fill out the Training Request form. Otherwise, you can register below.
Private Class Request
If your company is interested in private training, please submit a request.
Registration options
Databricks has a delivery method for wherever you are on your learning journey
Self-Paced
Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos
Inscrivez-vous maintenantInstructor-Led
Public and private courses taught by expert instructors across half-day to two-day courses
Inscrivez-vous maintenantBlended Learning
Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase
Purchase nowSkills@Scale
Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

