Revenir au contenu principal

Data Preparation for Machine Learning - French

Ce cours se concentre sur les fondamentaux de la préparation des données pour le machine learning avec Databricks. Les participants acquerront les compétences essentielles pour explorer, nettoyer et organiser les données en vue d'applications de machine learning traditionnelles. Les sujets clés comprennent la visualisation des données, l'Ingénierie des caractéristiques et les stratégies optimales de stockage des fonctionnalités. Grâce à des exercices pratiques, les participants acquerront une expérience concrète dans la préparation efficace de jeux de données pour le machine learning au sein de Databricks. Ce cours est conçu pour les data scientists de niveau associé et les praticiens du machine learning, ainsi que pour les personnes souhaitant renforcer leurs compétences en préparation des données, garantissant ainsi une base solide pour le déploiement Réussi d'un Modèle de machine learning.


Remarque: Databricks Academy passe à un format basé sur des cahiers de travail pour les sessions en présentiel au sein de l'environnement Databricks, et abandonne ainsi l'utilisation de présentations PowerPoint pour les cours magistraux. Vous pouvez accéder aux cahiers de travail des cours dans l'environnement de laboratoire Vocareum.


Languages Available: English | 日本語 | Português BR | 한국어

Skill Level
Associate
Duration
4h
Prerequisites

Le contenu a été développé pour des participants possédant les compétences/connaissances/aptitudes suivantes:

• Avoir suivi le cours Get Started with Databricks for Machine Learning (Onboarding) ou posséder des connaissances fondamentales équivalentes sur l'utilisation de l'environnement Databricks.

    - Les apprenants doivent être familiarisés avec la navigation dans le Databricks workspace, la création et l'exécution de notebooks, ainsi que la compréhension du workflow de base du machine learning sur Databricks. Ce cours s'appuie sur ces bases pour se concentrer sur la préparation des données pour le machine learning.

• Maîtrise intermédiaire de la programmation Python pour la préparation et l'analyse des données.

    - Les apprenants doivent être à l'aise avec l'utilisation de bibliothèques telles que Pandas, NumPy et scikit-learn pour la manipulation des données, la gestion des valeurs manquantes et les transformations de base des fonctionnalités.

• Compréhension fondamentale des principes du machine learning.

    - Cela inclut la familiarité avec des concepts tels que les jeux de données d'entraînement et de test, l'ingénierie des caractéristiques et les pipelines de développement de modèles.

• Familiarité avec les workflows de la Databricks Platform.

    - Les apprenants doivent être capables d'effectuer des tâches de base telles que la création de clusters, l'exécution de code dans des notebooks et l'utilisation des opérations courantes des notebooks.

• Connaissance de base des formats de données et des concepts du lakehouse.

    - Les apprenants doivent être familiarisés avec les formats de données courants tels que CSV, JSON et Parquet, et posséder une connaissance introductive de Delta Lake et de l'architecture Lakehouse.

• Compréhension fondamentale de l'analyse exploratoire des données et des statistiques de base.

    - Cela inclut la connaissance des distributions de données, des valeurs manquantes, des valeurs aberrantes et des techniques simples de visualisation des données utilisées pour évaluer la qualité des données.

Outline

Gestion et exploration des données

• Gestion et exploration des données dans le Lakehouse

• Démo: Charger et Explorer les données

• Atelier: Charger et Explorer les données


Préparation des données et ingénierie des caractéristiques

• Fondamentaux de la préparation des données et de l'ingénierie des caractéristiques

• Imputation de données

• Encodage des données

• Normalisation des données

• Démo: Pipeline de données d'imputation et de transformation

• Démo: Créer un Pipeline d'Ingénierie des Caractéristiques avec des Embeddings

• Atelier: Créer un Pipeline d'Ingénierie des caractéristiques


Feature Store

• Introduction au Feature Store

• Démo: Utilisation du Feature Store pour l'ingénierie des caractéristiques

• Atelier: Ingénierie des caractéristiques avec Feature Store

Public Class Registration

If your company has purchased success credits or has a learning subscription, please fill out the Training Request form. Otherwise, you can register below.

Private Class Request

If your company is interested in private training, please submit a request.

See all our registration options

Registration options

Databricks has a delivery method for wherever you are on your learning journey

Runtime

Self-Paced

Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos

Inscrivez-vous maintenant

Instructors

Instructor-Led

Public and private courses taught by expert instructors across half-day to two-day courses

Inscrivez-vous maintenant

Learning

Blended Learning

Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase

Purchase now

Scale

Skills@Scale

Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

Upcoming Public Classes

Automated Deployment with Declarative Automation Bundles - French

Ce cours propose une revue approfondie des principes DevOps et de leur application aux projets Databricks. Il commence par un aperçu des concepts fondamentaux de DevOps, DataOps, intégration continue (CI), déploiement continu (CD) et tests, et explore comment ces principes peuvent s'appliquer aux pipelines d'ingénierie des données.

Le cours se concentre ensuite sur le déploiement continu au sein du processus CI/CD, en examinant des outils tels que l'API REST, le SDK et le CLI Databricks pour le déploiement de projets. Vous découvrirez les Declarative Automation Bundles (DABs) et leur place dans le processus CI/CD. Vous approfondirez leurs composants clés, la structure des dossiers et la façon dont ils accélèrent le déploiement dans divers environnements cibles sur Databricks. Vous apprendrez également à ajouter des variables, modifier, valider, déployer et exécuter des Declarative Automation Bundles pour plusieurs environnements avec différentes configurations via le CLI Databricks.

Enfin, le cours présente Visual Studio Code comme environnement de développement interactif (IDE) pour construire, tester et déployer des Declarative Automation Bundles localement, en optimisant le processus de développement. Le cours se termine par une introduction à l'automatisation des pipelines de déploiement avec GitHub Actions afin d'améliorer le flux de travail CI/CD avec les Declarative Automation Bundles.

À la fin de ce cours, vous serez prêt à automatiser les déploiements de projets Databricks avec les Declarative Automation Bundles, en améliorant l'efficacité grâce aux pratiques DevOps.

Remarque: Databricks Academy passe à un format basé sur des cahiers de travail pour les sessions en présentiel au sein de l'environnement Databricks, et abandonne ainsi l'utilisation de présentations PowerPoint pour les cours magistraux. Vous pouvez accéder aux cahiers de travail des cours dans l'environnement de laboratoire Vocareum.

Languages Available: English | 日本語 | Português BR | 한국어

Paid
4h
Lab
instructor-led
Professional

Advanced Techniques with Apache Spark Declarative Pipelines - French

Ce cours explore les Pipeline déclaratifs Apache Spark (SDP) de Databricks pour la création de pipelines streaming de qualité production. Vous apprendrez des modèles de conception avancés, une application robuste de la qualité des données et une intégration multiplateforme essentiels pour l'ingénierie lakehouse en conditions réelles.

Tout au long du cours, vous plongerez dans les techniques modernes d'Ingestion de données et de traitement, en maîtrisant des outils tels que le clustering liquide pour l'optimisation de la Disposition et le modèle de streaming Multiplex pour les événements à schémas mixtes. À la fin des modules, vous saurez gérer en toute confiance l'évolution du schéma, automatiser le change data capture (CDC) et garantir l'Intégrité des données.

À travers des cours magistraux et des démonstrations pratiques, vous allez:

• Construire des pipelines multi-flux pour ingérer des données multi-sources dans une table Bronze unifiée.

• Appliquer le clustering liquide et les attentes de qualité des données sur les couches Argent et gold.

• Implémenter le modèle Multiplex avec Iceberg UniForm pour un accès aux données multiplateforme.

• Automatiser le suivi de l'historique SCD de type 2 à l'aide d'AUTO CDC INTO.

• Concevoir des pipelines de quarantaine sans perte de données pour auditer et gérer les enregistrements non valides.

Remarque: Databricks Academy passe à un format basé sur des cahiers de travail pour les sessions en présentiel au sein de l'environnement Databricks, et abandonne ainsi l'utilisation de présentations PowerPoint pour les cours magistraux. Vous pouvez accéder aux cahiers de travail des cours dans l'environnement de laboratoire Vocareum.

Languages Available: English | 日本語 | Português BR | 한국어

Paid
4h
Lab
instructor-led
Professional

Questions?

If you have any questions, please refer to our Frequently Asked Questions page.