Revenir au contenu principal

Data Preparation for Machine Learning - French

Ce cours se concentre sur les fondamentaux de la préparation des données pour le machine learning avec Databricks. Les participants acquerront les compétences essentielles pour explorer, nettoyer et organiser les données en vue d'applications de machine learning traditionnelles. Les sujets clés comprennent la visualisation des données, l'Ingénierie des caractéristiques et les stratégies optimales de stockage des fonctionnalités. Grâce à des exercices pratiques, les participants acquerront une expérience concrète dans la préparation efficace de jeux de données pour le machine learning au sein de Databricks. Ce cours est conçu pour les data scientists de niveau associé et les praticiens du machine learning, ainsi que pour les personnes souhaitant renforcer leurs compétences en préparation des données, garantissant ainsi une base solide pour le déploiement Réussi d'un Modèle de machine learning.


Remarque: Databricks Academy passe à un format basé sur des cahiers de travail pour les sessions en présentiel au sein de l'environnement Databricks, et abandonne ainsi l'utilisation de présentations PowerPoint pour les cours magistraux. Vous pouvez accéder aux cahiers de travail des cours dans l'environnement de laboratoire Vocareum.


Languages Available: English | 日本語 | Português BR | 한국어

Skill Level
Associate
Duration
4h
Prerequisites

Le contenu a été développé pour des participants possédant les compétences/connaissances/aptitudes suivantes:

• Avoir suivi le cours Get Started with Databricks for Machine Learning (Onboarding) ou posséder des connaissances fondamentales équivalentes sur l'utilisation de l'environnement Databricks.

    - Les apprenants doivent être familiarisés avec la navigation dans le Databricks workspace, la création et l'exécution de notebooks, ainsi que la compréhension du workflow de base du machine learning sur Databricks. Ce cours s'appuie sur ces bases pour se concentrer sur la préparation des données pour le machine learning.

• Maîtrise intermédiaire de la programmation Python pour la préparation et l'analyse des données.

    - Les apprenants doivent être à l'aise avec l'utilisation de bibliothèques telles que Pandas, NumPy et scikit-learn pour la manipulation des données, la gestion des valeurs manquantes et les transformations de base des fonctionnalités.

• Compréhension fondamentale des principes du machine learning.

    - Cela inclut la familiarité avec des concepts tels que les jeux de données d'entraînement et de test, l'ingénierie des caractéristiques et les pipelines de développement de modèles.

• Familiarité avec les workflows de la Databricks Platform.

    - Les apprenants doivent être capables d'effectuer des tâches de base telles que la création de clusters, l'exécution de code dans des notebooks et l'utilisation des opérations courantes des notebooks.

• Connaissance de base des formats de données et des concepts du lakehouse.

    - Les apprenants doivent être familiarisés avec les formats de données courants tels que CSV, JSON et Parquet, et posséder une connaissance introductive de Delta Lake et de l'architecture Lakehouse.

• Compréhension fondamentale de l'analyse exploratoire des données et des statistiques de base.

    - Cela inclut la connaissance des distributions de données, des valeurs manquantes, des valeurs aberrantes et des techniques simples de visualisation des données utilisées pour évaluer la qualité des données.

Outline

Gestion et exploration des données

• Gestion et exploration des données dans le Lakehouse

• Démo: Charger et Explorer les données

• Atelier: Charger et Explorer les données


Préparation des données et ingénierie des caractéristiques

• Fondamentaux de la préparation des données et de l'ingénierie des caractéristiques

• Imputation de données

• Encodage des données

• Normalisation des données

• Démo: Pipeline de données d'imputation et de transformation

• Démo: Créer un Pipeline d'Ingénierie des Caractéristiques avec des Embeddings

• Atelier: Créer un Pipeline d'Ingénierie des caractéristiques


Feature Store

• Introduction au Feature Store

• Démo: Utilisation du Feature Store pour l'ingénierie des caractéristiques

• Atelier: Ingénierie des caractéristiques avec Feature Store

Public Class Registration

If your company has purchased success credits or has a learning subscription, please fill out the Training Request form. Otherwise, you can register below.

Private Class Request

If your company is interested in private training, please submit a request.

See all our registration options

Registration options

Databricks has a delivery method for wherever you are on your learning journey

Runtime

Self-Paced

Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos

Inscrivez-vous maintenant

Instructors

Instructor-Led

Public and private courses taught by expert instructors across half-day to two-day courses

Inscrivez-vous maintenant

Learning

Blended Learning

Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase

Purchase now

Scale

Skills@Scale

Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

Upcoming Public Classes

Apache Spark Programming with Databricks - French

Ce cours d'introduction constitue un point de départ approprié pour apprendre le Data Engineering avec Databricks.

Ci-dessous, nous décrivons chacun des quatre modules de quatre heures inclus dans ce cours.

Remarque : pour les quatre modules suivants, Databricks Academy adopte progressivement un format basé sur des notebooks pour les sessions en salle de classe au sein de l'environnement Databricks, abandonnant l'utilisation de diaporamas pour les cours. Vous pouvez accéder aux notebooks de cours dans l'environnement de lab Vocareum.

Introduction to Apache Spark

Ce cours accessible aux débutants couvre les fondamentaux d'Apache Spark pour le traitement de données à grande échelle. Vous explorerez l'architecture distribuée de Spark, maîtriserez l'API DataFrame et apprendrez à lire, écrire et traiter des données avec Python. Grâce à des exercices pratiques, vous développerez les compétences nécessaires pour exécuter efficacement des transformations et des actions Spark.

Developing Applications with Apache Spark

Maîtrisez le traitement de données à grande échelle avec Apache Spark dans ce cours. Apprenez à construire des pipelines ETL efficaces, à effectuer des analyses de données avancées et à optimiser les transformations de données distribuées à l'aide de l'API DataFrame de Spark. Explorez le regroupement, l'agrégation, les jointures, les opérations sur les ensembles et les fonctions de fenêtrage. Travaillez avec des types de données complexes tels que les tableaux, les maps et les structs, tout en appliquant les meilleures pratiques d'optimisation des performances.

Stream Processing and Analysis with Apache Spark

Ce cours guide les apprenants sur la manière de développer des applications de traitement de stream évolutives et tolérantes aux pannes en utilisant l'API Spark Structured Streaming sur Databricks.

Monitoring and Optimizing Apache Spark Workloads on Databricks

Ce cours couvre les composants essentiels de la plateforme Databricks et Apache Spark avec Delta Lake, en mettant l'accent sur l'architecture Lakehouse, Unity Catalog et les techniques de Gestion des données telles que les Transactions ACID et la maintenance des tables. De plus, il enseigne aux étudiants comment Optimiser la performance des requêtes grâce au partitionnement, aux shuffles et aux outils de réglage, tout en utilisant le Spark UI pour surveiller les applications et résoudre les goulots d'étranglement.

Languages Available: English | 日本語 | 한국어

Paid
16h
Lab
instructor-led
Associate

Questions?

If you have any questions, please refer to our Frequently Asked Questions page.