Ir para o conteúdo principal

Data Preparation for Machine Learning - Portuguese BR

Este curso se concentra nos fundamentos da preparação de dados para machine learning usando o Databricks. Os participantes aprenderão habilidades essenciais para explorar, limpar e organizar dados voltados para aplicações tradicionais de machine learning. Os principais tópicos incluem visualização de dados, Engenharia de Recursos e estratégias ideais de armazenamento de recursos. Por meio de exercícios práticos, os participantes adquirirão experiência prática na preparação eficiente de conjuntos de dados para machine learning no Databricks. Este curso foi desenvolvido para cientistas de dados de nível associado e profissionais de machine learning, bem como para indivíduos que buscam aprimorar sua proficiência na preparação de dados, garantindo uma base sólida para a implantação com Êxito de modelo do machine learning.


Nota: A Databricks Academy está fazendo a transição para um formato baseado em notebooks para as sessões em sala de aula dentro do ambiente Databricks, descontinuando o uso de apresentações de slides para as aulas. Você pode acessar os notebooks de aula no ambiente de laboratório do Vocareum.


Languages Available: English | 日本語 | Português BR | 한국어

Skill Level
Associate
Duration
4h
Prerequisites

Neste curso, o conteúdo foi desenvolvido para participantes que possuam as seguintes competências/conhecimentos/habilidades: 

• Concluiu o curso Get Started with Databricks for Machine Learning (Onboarding) ou possui conhecimento fundamental equivalente sobre como trabalhar no ambiente Databricks.

    - Os alunos devem estar familiarizados com a navegação no Databricks workspace, criação e execução de notebooks, e compreensão do fluxo de trabalho básico de machine learning no Databricks. Este curso baseia-se nessa fundação para focar na preparação de dados para machine learning.

• Proficiência de nível intermediário em programação Python para preparação de dados e análise.

    - Os alunos devem estar confortáveis com o uso de bibliotecas como Pandas, NumPy e Scikit-Learn para manipulação de dados, tratamento de valores ausentes e transformações básicas de recursos.

• Compreensão básica dos fundamentos de machine learning.

    - Isso inclui familiaridade com conceitos como conjuntos de dados de treinamento e teste, Engenharia de Recursos e pipelines de desenvolvimento de modelos.

• Familiaridade com os fluxos de trabalho da Databricks Platform.

    - Os alunos devem ser capazes de realizar tarefas básicas, como criar clusters, executar código em notebooks e utilizar operações comuns de notebook.

• Conhecimento básico de formatos de dados e conceitos de lakehouse.

    - Os alunos devem estar familiarizados com formatos de dados comuns, como CSV, JSON e Parquet, e ter conhecimento introdutório sobre Delta Lake e a arquitetura Lakehouse.

• Compreensão fundamental de análise exploratória de dados e estatística básica.

    - Isso inclui o conhecimento sobre distribuições de dados, valores ausentes, outliers e técnicas simples de visualização de dados utilizadas para avaliar a qualidade dos dados.

Outline

Gerenciando e Explorando Dados

• Gerenciando e Explorando Dados no Lakehouse

• Demonstração: Carregar e Explorar Dados

• Laboratório: Carregar e Explorar Dados


Preparação de Dados e Engenharia de Recursos

• Fundamentos de Preparação de Dados e Engenharia de Recursos

• Imputação de Dados

• Codificação de Dados

• Padronização de Dados

• Demonstração: Pipeline de Imputação e Transformação de Dados

• Demonstração: Construir um Pipeline de Engenharia de Recursos com Embeddings

• Laboratório: Construir um Pipeline de Engenharia de Recursos


Feature Store

• Introdução ao Feature Store

• Demonstração: Usando Feature Store para Engenharia de Recursos

• Laboratório: Engenharia de Recursos com Feature Store

Upcoming Public Classes

Date
Time
Your Local Time
Language
Price
Nov 05
09 AM - 01 PM (America/Sao_Paulo)
-
Portuguese - BR
$750.00

Public Class Registration

If your company has purchased success credits or has a learning subscription, please fill out the Training Request form. Otherwise, you can register below.

Private Class Request

If your company is interested in private training, please submit a request.

See all our registration options

Registration options

Databricks has a delivery method for wherever you are on your learning journey

Runtime

Self-Paced

Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos

Registre-se agora

Instructors

Instructor-Led

Public and private courses taught by expert instructors across half-day to two-day courses

Registre-se agora

Learning

Blended Learning

Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase

Purchase now

Scale

Skills@Scale

Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

Upcoming Public Classes

Advanced Machine Learning with Databricks - Portuguese BR

Este curso é destinado a cientistas de dados e profissionais de machine learning e é composto por dois módulos de quatro horas.

Machine Learning at Scale

Neste curso, você adquirirá conhecimento teórico e prático sobre a arquitetura do Apache Spark e sua aplicação em cargas de trabalho de machine learning no Databricks. Você aprenderá quando usar o Spark para preparação de dados, treinamento de modelos e implantação, além de obter experiência prática com Spark ML e APIs do Pandas no Spark. Este curso apresentará conceitos avançados, como ajuste de hiperparâmetros e escalabilidade do Optuna com Spark. Este curso utilizará recursos e conceitos introduzidos no curso associado, como MLflow e Unity Catalog, para empacotamento e governança abrangentes de modelos.

Advanced Machine Learning Operations

Neste curso, você receberá uma compreensão abrangente do ciclo de vida de machine learning e de MLOps, com ênfase nas melhores práticas para gerenciamento de dados e modelos, testes e arquiteturas escaláveis. O curso aborda os principais componentes de MLOps, incluindo CI/CD, gerenciamento de pipeline e separação de ambientes, ao mesmo tempo em que apresenta as ferramentas do Databricks para automação e gerenciamento de infraestrutura, como Declarative Automation Bundles (DABs), Lakeflow Jobs e Model Serving. Você aprenderá sobre monitoramento, métricas personalizadas, detecção de desvios, estratégias de implantação de modelos, testes A/B e os princípios de sistemas MLOps confiáveis, proporcionando uma visão holística da implementação e do gerenciamento de projetos de ML no Databricks.

Nota: A Databricks Academy está fazendo a transição para um formato baseado em notebooks para as sessões em sala de aula dentro do ambiente Databricks, descontinuando o uso de apresentações de slides para as aulas. Você pode acessar os notebooks de aula no ambiente de laboratório do Vocareum.

Paid
8h
Lab
instructor-led
Professional

Questions?

If you have any questions, please refer to our Frequently Asked Questions page.