Ir para o conteúdo principal

Data Engineering with Databricks - Portuguese BR

Este é um curso introdutório que serve como um ponto de entrada adequado para aprender Data Engineering com o Databricks.

A seguir, descrevemos cada um dos quatro módulos de quatro horas incluídos neste curso.


Nota: para os quatro módulos a seguir, a Databricks Academy está migrando para um formato baseado em notebooks nas sessões em sala de aula dentro do ambiente Databricks, descontinuando o uso de apresentações de slides nas aulas. Você pode acessar os notebooks das aulas no ambiente de lab do Vocareum.


1. Data Ingestion with Lakeflow Connect

Este curso oferece uma introdução abrangente ao Lakeflow Connect, uma solução escalável e simplificada para ingerir dados no Databricks a partir de uma ampla variedade de fontes. Você começará explorando os diferentes tipos de conectores do Lakeflow Connect (Standard e Managed) e aprenderá diversas técnicas de ingestão de dados, incluindo ingestão em batch, batch incremental e streaming. Você também revisará os principais benefícios do uso da Delta table e da arquitetura Medallion.


Em seguida, você desenvolverá habilidades práticas para ingerir dados do cloud object storage usando os Lakeflow Connect Standard Connectors. Isso inclui trabalhar com métodos como CREATE TABLE AS SELECT (CTAS), COPY INTO e Auto Loader, com ênfase nos benefícios e nas considerações de cada abordagem. Você também aprenderá a acrescentar colunas de metadados às suas tabelas de nível bronze durante a ingestão na Databricks Data Intelligence Platform. O curso aborda então como lidar com registros que não correspondem ao schema da sua tabela usando a coluna rescued data, além de estratégias para gerenciar e analisar esses dados. Você também explorará técnicas para ingerir e achatar dados JSON semiestruturados.


Depois disso, você explorará como realizar ingestão de dados de nível empresarial usando os Lakeflow Connect Managed Connectors para trazer dados de bancos de dados e aplicações Software-as-a-Service (SaaS). O curso também apresenta o Partner Connect como uma opção para integrar ferramentas de parceiros às suas cargas de trabalho de ingestão.


Por fim, o curso é encerrado com estratégias alternativas de ingestão, incluindo operações MERGE INTO e o uso do Databricks Marketplace, proporcionando uma base sólida para dar suporte a casos de uso modernos de data engineering.


2. Deploy Workloads with Lakeflow Jobs

O curso Deploy Workloads with Lakeflow Jobs ensina como orquestrar e automatizar fluxos de trabalho de dados, analytics e IA usando o Lakeflow Jobs como uma plataforma de orquestração unificada dentro do ecossistema Databricks.


Você aprenderá a projetar e implementar cargas de trabalho de dados usando Directed Acyclic Graphs (DAGs), configurar várias opções de agendamento e implementar recursos avançados de fluxo de trabalho, como execução condicional de tarefas, dependências run-if e loops for each.

O curso aborda as práticas recomendadas para criar pipelines robustos e prontos para produção, com seleção adequada de compute, orquestração modular, técnicas de tratamento de erros e design tolerante a falhas — tudo integrado nativamente à Databricks Data Intelligence Platform.


3. Build Data Pipelines with Apache Spark Declarative Pipelines

Este curso apresenta aos usuários os conceitos e as habilidades essenciais necessários para criar pipelines de dados usando o Apache Spark Declarative Pipelines (SDP) no Databricks para ingestão e processamento em batch incremental ou streaming por meio de várias streaming tables e materialized views. Projetado para data engineers iniciantes no Spark Declarative Pipelines, o curso oferece uma visão geral abrangente de componentes essenciais, como processamento incremental de dados, streaming tables, materialized views e temporary views, destacando seus propósitos específicos e suas diferenças.


Os tópicos abordados incluem:

Desenvolvimento e depuração de pipelines de ETL com o editor multiarquivo do Spark Declarative Pipelines usando SQL (com exemplos de código em Python fornecidos)

Como o Spark Declarative Pipelines rastreia as dependências de dados em um pipeline por meio do pipeline graph

Configuração de recursos de compute do pipeline, ativos de dados, modos de acionamento e outras opções avançadas


Em seguida, o curso apresenta as data quality expectations no Spark Declarative Pipelines, orientando os usuários no processo de integração de expectations aos pipelines para validar e impor a integridade dos dados. Os alunos exploram então como colocar um pipeline em produção, incluindo opções de agendamento, e como habilitar o registro de eventos do pipeline para monitorar seu desempenho e sua integridade.


Por fim, o curso aborda como implementar Change Data Capture (CDC) usando a sintaxe AUTO CDC INTO no Spark Declarative Pipelines para gerenciar slowly changing dimensions (SCD Type 1 e Type 2), preparando os usuários para integrar o CDC aos seus próprios pipelines.


4. DevOps Essentials for Data Engineering

Este curso explora as práticas recomendadas de engenharia de software e os princípios de DevOps, especificamente desenvolvidos para data engineers que trabalham com o Databricks. Os participantes construirão uma base sólida em tópicos-chave, como qualidade de código, controle de versão, documentação e testes. O curso enfatiza o DevOps, abordando seus componentes essenciais, benefícios e o papel da integração e entrega contínuas (CI/CD) na otimização dos fluxos de trabalho de data engineering.


Você aprenderá a aplicar princípios de modularidade no PySpark para criar componentes reutilizáveis e estruturar o código de forma eficiente. A experiência prática inclui projetar e implementar testes unitários para funções do PySpark usando o framework pytest, seguidos de testes de integração para pipelines de dados do Databricks com Spark Declarative Pipeline e Jobs para garantir a confiabilidade.


O curso também aborda operações essenciais do Git no Databricks, incluindo o uso das Databricks Git Folders para integrar práticas de integração contínua. Por fim, você terá uma visão geral de vários métodos de deployment de ativos do Databricks, como REST API, CLI, SDK e Declarative Automation Bundles (DABs), proporcionando o conhecimento das técnicas para fazer o deployment e gerenciar seus pipelines.


Ao final do curso, você dominará as práticas recomendadas de engenharia de software e DevOps, o que lhe permitirá criar soluções de data engineering escaláveis, fáceis de manter e eficientes.


Languages Available: English | 日本語 | Português BR | 한국어 | Español | française

Skill Level
Associate
Duration
16h
Prerequisites

1. Data Ingestion with Lakeflow Connect

Compreensão básica da Databricks Data Intelligence Platform, incluindo os Databricks Workspaces, o Apache Spark, o Delta Lake, a arquitetura Medallion e o Unity Catalog.

Compreensão básica dos fluxos de trabalho de ingestão de dados (batch, streaming, incremental) e dos princípios gerais de ETL.

Experiência com diversos formatos de arquivo (por exemplo, Parquet, CSV, JSON, TXT).

Proficiência em SQL e Python.

Familiaridade com a execução de código em notebooks do Databricks.


2. Deploy Workloads with Lakeflow Jobs

Conclusão do curso "Get Started with Databricks for Data Engineering" ou uma compreensão sólida da Databricks Data Intelligence Platform.

Compreensão básica de tópicos como navegação em um Databricks Workspace, Apache Spark, Delta Lake, arquitetura Medallion e Unity Catalog.

Familiaridade com Python/PySpark.

Experiência na escrita de consultas SQL de nível intermediário.


3. Build Data Pipelines with Apache Spark Declarative Pipelines

Compreensão básica da Databricks Data Intelligence Platform, incluindo os Databricks Workspaces, o Apache Spark, o Delta Lake, a arquitetura Medallion, o Lakeflow Jobs e o Unity Catalog.

 Experiência na ingestão de dados brutos em Delta tables, incluindo o uso da função SQL read_files para carregar formatos como CSV, JSON, TXT e Parquet.

Proficiência na transformação de dados usando SQL, incluindo a escrita de consultas de nível intermediário e uma compreensão básica de joins em SQL.

Compreensão dos conceitos de ETL e dos fluxos de trabalho de batch/streaming.


4. DevOps Essentials for Data Engineering

Conhecimento proficiente da plataforma Databricks, incluindo experiência com Databricks Workspaces, Apache Spark, Delta Lake e a arquitetura Medallion, Unity Catalog, Delta Live Tables e Workflows. Também é necessária uma compreensão básica do controle de versão com Git.

Experiência na ingestão e transformação de dados, com proficiência em PySpark para processamento de dados e manipulações de DataFrame. Além disso, os candidatos devem ter experiência na escrita de consultas SQL de nível intermediário para análise e transformação de dados.

Conhecimento de programação em Python, com proficiência na escrita de código Python de nível intermediário, incluindo a capacidade de projetar e implementar funções e classes. Os usuários também devem ser habilidosos em criar, importar e utilizar pacotes Python de forma eficaz.

Outline

1. Data Ingestion with Lakeflow Connect

• Data Engineering no Databricks

• Explorando o ambiente de lab

• Ingestão de dados do cloud storage

• Demonstração - Ingestão de dados com CREATE TABLE AS e COPY INTO

• Demonstração - Criar streaming tables com SQL usando o Auto Loader

• Acrescentar colunas de metadados na ingestão

• Demonstração - Adicionar colunas de metadados durante a ingestão

• Trabalhando com a coluna Rescued Data

• Demonstração - Tratar a ingestão de CSV com a coluna Rescued Data

• Lab - Criar Bronze tables a partir de arquivos CSV

• Ingestão de dados semiestruturados: JSON

• Demonstração - Ingerir arquivos JSON com o Databricks

• Lab - Criar Bronze tables a partir de arquivos JSON

• Visão geral da ingestão de dados corporativos

• Demonstração - Ingestão de dados corporativos com o LakeFlow Connect

• Recursos adicionais e ingestão em Delta Tables existentes

• Demonstração - BÔNUS - Ingestão de dados com MERGE INTO


2. Deploy Workloads with Lakeflow Jobs

• Introdução ao Data Engineering no Databricks

• Componentes essenciais do Lakeflow Jobs

• Visão geral do projeto do curso

• Demonstração: Criar um job usando a interface do Lakeflow Jobs

• Lab: Crie seu primeiro job

• Criação e agendamento de jobs

• Demonstração: Automatizar cargas de trabalho com agendamento e gatilhos

• Tarefa condicional e iterativa

• Demonstração: Criar cargas de trabalho dinâmicas com tarefas avançadas

• Lab: Adicionar uma tarefa If-Else e automatizar seu job

• Tratamento de falhas de tarefas e monitoramento do desempenho dos jobs

• Demonstração: Monitorar e reparar tarefas

• Lakeflow Jobs em produção e práticas recomendadas

• LAB BÔNUS: Orquestração modular


3. Build Data Pipelines with Apache Spark Declarative Pipelines

• Introdução ao Data Engineering no Databricks

• Demonstração: Configuração do curso e criação de um pipeline

• Visão geral do projeto do curso e dos tipos de dataset

• Desenvolvimento simplificado de pipelines e configurações comuns de pipeline

• Demonstração: Desenvolver um pipeline simples

• Garantir a qualidade dos dados com Expectations

• Demonstração: Adicionar Expectations de qualidade de dados

• Lab: Criar um pipeline

• Streaming joins e deployment de pipelines para produção

• Demonstração: Fazer o deployment de um pipeline para produção

• Visão geral do Change Data Capture (CDC)

• Demonstração: Change Data Capture com AUTO CDC e SCD TYPE 1

• Lab bônus: AUTO CDC INTO com SCD Type 1


4. DevOps Essentials for Data Engineering

Continuous Integration (CI)

• Introdução às práticas recomendadas de engenharia de software (SWE)

• Introdução à modularização de código PySpark

• Demonstração: Modularizar código PySpark - OBRIGATÓRIO

• Lab: Modularizar código PySpark

• Fundamentos de DevOps

• O papel de CI e CD no DevOps

• Planejamento do projeto

• Demonstração: Exploração da configuração do projeto

• Introdução aos testes unitários para PySpark

• Demonstração: Criar e executar testes unitários

• Lab: Criar e executar testes unitários

• Executar testes de integração com SDP e Jobs

• Demonstração: Realizar testes de integração

• Visão geral do controle de versão com Git

• Lab: Controle de versão com Databricks Git Folders e GitHub

Continuous Deployment (CD)

• Visão geral do deployment de ativos do Databricks

• Demonstração: Fazer o deployment dos ativos do Databricks

Public Class Registration

If your company has purchased success credits or has a learning subscription, please fill out the Training Request form. Otherwise, you can register below.

Private Class Request

If your company is interested in private training, please submit a request.

See all our registration options

Registration options

Databricks has a delivery method for wherever you are on your learning journey

Runtime

Self-Paced

Custom-fit learning paths for data, analytics, and AI roles and career paths through on-demand videos

Registre-se agora

Instructors

Instructor-Led

Public and private courses taught by expert instructors across half-day to two-day courses

Registre-se agora

Learning

Blended Learning

Self-paced and weekly instructor-led sessions for every style of learner to optimize course completion and knowledge retention. Go to Subscriptions Catalog tab to purchase

Purchase now

Scale

Skills@Scale

Comprehensive training offering for large scale customers that includes learning elements for every style of learning. Inquire with your account executive for details

Upcoming Public Classes

Questions?

If you have any questions, please refer to our Frequently Asked Questions page.