Revenir au contenu principal

DevOps Essentials for Data Engineering - French

Ce cours explore les meilleures pratiques d'ingénierie software et les principes DevOps, spécifiquement conçu pour les data engineers travaillant avec Databricks. Les participants développeront des bases solides dans des domaines clés tels que la qualité du code, le contrôle de version, la documentation et les tests. Le cours met l'accent sur le DevOps, en couvrant ses composantes essentielles, ses avantages et le rôle de l'intégration et de la livraison continues (CI/CD) dans l'optimisation des workflows de data engineering.


Vous apprendrez à appliquer les principes de modularité dans PySpark pour créer des composants réutilisables et structurer le code de manière efficace. La mise en pratique comprend la conception et l'implémentation de tests unitaires pour des fonctions PySpark à l'aide du Cadre pytest, suivies de tests d'intégration pour les data pipelines Databricks avec Spark Declarative Pipeline et Jobs afin de garantir leur fiabilité.


Le cours couvre également les opérations Git essentielles dans Databricks, notamment l'utilisation des Databricks Git Folders pour intégrer les pratiques d'intégration continue. Enfin, vous aurez un aperçu de haut niveau des différentes méthodes de déploiement des ressources Databricks, telles que REST API, CLI, SDK et Declarative Automation Bundles (DABs), vous fournissant ainsi les connaissances nécessaires pour déployer et gérer vos pipelines.


À l'issue du cours, vous maîtriserez les meilleures pratiques d'ingénierie software et de DevOps, vous permettant de construire des solutions de data engineering évolutives, maintenables et efficaces.


Remarque : Databricks Academy passe à un format basé sur des cahiers de travail pour les sessions en présentiel au sein de l'environnement Databricks, et abandonne ainsi l'utilisation de présentations PowerPoint pour les cours magistraux. Vous pouvez accéder aux cahiers de travail des cours dans l'environnement de laboratoire Vocareum.


Languages Available: English | 日本語 | Português BR | 한국어 | Español | française

Skill Level
Associate
Duration
4h
Prerequisites

• Connaissance approfondie de la Databricks platform, notamment une expérience avec les Databricks Workspaces, Apache Spark, Delta Lake et la Medallion Architecture, Unity Catalog, Delta Live Tables et les Workflows. Une compréhension de base du contrôle de version Git est également requise.

• Expérience dans l'ingestion et la transformation de données, avec une maîtrise de PySpark pour le traitement des données et les manipulations de DataFrame. De plus, les candidats doivent avoir de l'expérience dans la rédaction de requêtes SQL de niveau intermédiaire pour l'analyse et la transformation des données.

• Connaissance de la programmation Python, avec une maîtrise de l'écriture de code Python de niveau intermédiaire, notamment la capacité à concevoir et à implémenter des fonctions et des classes. Les utilisateurs doivent également être compétents dans la création, l'importation et l'utilisation efficace de packages Python.

Outline

DevOps Essentials for Data Engineering - CI

• Introduction aux bonnes pratiques d'ingénierie software

• Introduction à la modularisation du code PySpark

• Modularisation du code PySpark - OBLIGATOIRE

• Lab - Modulariser le code PySpark

• DevOps Fundamentals

• Le rôle du CI et du CD dans DevOps

• Planification du projet

• Démo - Exploration de la configuration du projet

• Introduction aux tests unitaires pour PySpark

• Démo - Création et exécution de tests unitaires

• Lab - Créer et exécuter des tests unitaires

• Exécution des tests d'intégration avec SDP et Jobs

• Démo - Réalisation de tests d'intégration

• Aperçu du contrôle de version avec Git

• Lab - Contrôle de version avec Databricks Git Folders et GitHub


DevOps Essentials for Data Engineering - CD

• Présentation du déploiement des ressources Databricks

• Démo - Déploiement des ressources Databricks

Public Class Registration

If your company has purchased success credits or has a learning subscription, please fill out the Training Request form. Otherwise, you can register below.

Private Class Request

If your company is interested in private training, please submit a request.

See all our registration options

Registration options

Databricks has a delivery method for wherever you are on your learning journey

Runtime

Self-Paced

Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos

Inscrivez-vous maintenant

Instructors

Instructor-Led

Public and private courses taught by expert instructors across half-day to two-day courses

Inscrivez-vous maintenant

Learning

Blended Learning

Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase

Purchase now

Scale

Skills@Scale

Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

Upcoming Public Classes

Questions?

If you have any questions, please refer to our Frequently Asked Questions page.