Data Engineering with Databricks - Spanish
Este es un curso introductorio que sirve como un punto de entrada adecuado para aprender Data Engineering con Databricks.
A continuación, describimos cada uno de los cuatro módulos de cuatro horas incluidos en este curso.
Nota: para los siguientes cuatro módulos, Databricks Academy está migrando a un formato basado en notebooks para las sesiones en el aula dentro del entorno de Databricks, y dejará de usar diapositivas para las clases. Puede acceder a los notebooks de las clases en el entorno de lab de Vocareum.
1. Data Ingestion with Lakeflow Connect
Este curso ofrece una introducción integral a Lakeflow Connect, una solución escalable y simplificada para ingerir datos en Databricks desde una amplia variedad de fuentes. Comenzará explorando los diferentes tipos de conectores de Lakeflow Connect (Standard y Managed) y aprenderá diversas técnicas de ingesta de datos, incluidas la ingesta por batch, batch incremental y streaming. También repasará los principales beneficios de usar la Delta table y la arquitectura Medallion.
A continuación, desarrollará habilidades prácticas para ingerir datos desde cloud object storage utilizando los Lakeflow Connect Standard Connectors. Esto incluye trabajar con métodos como CREATE TABLE AS SELECT (CTAS), COPY INTO y Auto Loader, con énfasis en los beneficios y las consideraciones de cada enfoque. También aprenderá a agregar columnas de metadatos a sus tablas de nivel bronze durante la ingesta en la Databricks Data Intelligence Platform. Luego, el curso aborda cómo gestionar los registros que no coinciden con el schema de su tabla mediante la columna rescued data, junto con estrategias para administrar y analizar estos datos. También explorará técnicas para ingerir y aplanar datos JSON semiestructurados.
Después de esto, explorará cómo realizar una ingesta de datos de nivel empresarial utilizando los Lakeflow Connect Managed Connectors para incorporar datos desde bases de datos y aplicaciones Software-as-a-Service (SaaS). El curso también presenta Partner Connect como una opción para integrar herramientas de partners en sus cargas de trabajo de ingesta.
Por último, el curso concluye con estrategias de ingesta alternativas, incluidas las operaciones MERGE INTO y el aprovechamiento de Databricks Marketplace, lo que le proporcionará una base sólida para respaldar casos de uso modernos de data engineering.
2. Deploy Workloads with Lakeflow Jobs
El curso Deploy Workloads with Lakeflow Jobs enseña a orquestar y automatizar flujos de trabajo de datos, analytics e IA utilizando Lakeflow Jobs como una plataforma de orquestación unificada dentro del ecosistema de Databricks.
• Aprenderá a diseñar e implementar cargas de trabajo de datos mediante Directed Acyclic Graphs (DAGs), a configurar diversas opciones de programación y a implementar funciones avanzadas de flujo de trabajo, como la ejecución condicional de tareas, las dependencias run-if y los bucles for each.
• El curso abarca las prácticas recomendadas para crear pipelines robustos y listos para producción, con una selección adecuada de compute, orquestación modular, técnicas de manejo de errores y un diseño tolerante a fallos, todo ello integrado de forma nativa en la Databricks Data Intelligence Platform.
3. Build Data Pipelines with Apache Spark Declarative Pipelines
Este curso presenta a los usuarios los conceptos y las habilidades esenciales necesarios para crear pipelines de datos utilizando Apache Spark Declarative Pipelines (SDP) en Databricks para la ingesta y el procesamiento por batch incremental o streaming a través de múltiples streaming tables y materialized views. Diseñado para data engineers que se inician en Spark Declarative Pipelines, el curso ofrece una descripción general integral de componentes esenciales como el procesamiento incremental de datos, las streaming tables, las materialized views y las temporary views, y destaca sus propósitos específicos y sus diferencias.
Los temas tratados incluyen:
• Desarrollo y depuración de pipelines de ETL con el editor multiarchivo de Spark Declarative Pipelines usando SQL (se proporcionan ejemplos de código en Python)
• Cómo Spark Declarative Pipelines rastrea las dependencias de datos en un pipeline a través del pipeline graph
• Configuración de los recursos de compute del pipeline, los activos de datos, los modos de activación y otras opciones avanzadas
A continuación, el curso presenta las data quality expectations en Spark Declarative Pipelines, y guía a los usuarios a través del proceso de integración de expectations en los pipelines para validar y hacer cumplir la integridad de los datos. Luego, los alumnos explorarán cómo poner un pipeline en producción, incluidas las opciones de programación, y cómo habilitar el registro de eventos del pipeline para supervisar su rendimiento y su estado.
Por último, el curso aborda cómo implementar Change Data Capture (CDC) mediante la sintaxis AUTO CDC INTO en Spark Declarative Pipelines para gestionar slowly changing dimensions (SCD Type 1 y Type 2), lo que prepara a los usuarios para integrar CDC en sus propios pipelines.
4. DevOps Essentials for Data Engineering
Este curso explora las prácticas recomendadas de ingeniería de software y los principios de DevOps, diseñados específicamente para data engineers que trabajan con Databricks. Los participantes construirán una base sólida en temas clave como la calidad del código, el control de versiones, la documentación y las pruebas. El curso hace hincapié en DevOps, y abarca sus componentes esenciales, sus beneficios y el papel de la integración y entrega continuas (CI/CD) en la optimización de los flujos de trabajo de data engineering.
Aprenderá a aplicar principios de modularidad en PySpark para crear componentes reutilizables y estructurar el código de manera eficiente. La experiencia práctica incluye diseñar e implementar pruebas unitarias para funciones de PySpark utilizando el framework pytest, seguidas de pruebas de integración para pipelines de datos de Databricks con Spark Declarative Pipeline y Jobs a fin de garantizar la fiabilidad.
El curso también abarca operaciones esenciales de Git en Databricks, incluido el uso de las Databricks Git Folders para integrar prácticas de integración continua. Por último, obtendrá una visión general de alto nivel de los diversos métodos de deployment de activos de Databricks, como REST API, CLI, SDK y Declarative Automation Bundles (DABs), lo que le proporcionará el conocimiento de las técnicas para desplegar y administrar sus pipelines.
Al finalizar el curso, dominará las prácticas recomendadas de ingeniería de software y DevOps, lo que le permitirá crear soluciones de data engineering escalables, fáciles de mantener y eficientes.
Languages Available: English | 日本語 | Português BR | 한국어 | Español | française
1. Data Ingestion with Lakeflow Connect
• Comprensión básica de la Databricks Data Intelligence Platform, incluidos los Databricks Workspaces, Apache Spark, Delta Lake, la arquitectura Medallion y Unity Catalog.
• Comprensión básica de los flujos de trabajo de ingesta de datos (batch, streaming, incremental) y de los principios generales de ETL.
• Experiencia con diversos formatos de archivo (por ejemplo, Parquet, CSV, JSON, TXT).
• Dominio de SQL y Python.
• Familiaridad con la ejecución de código en notebooks de Databricks.
2. Deploy Workloads with Lakeflow Jobs
• Finalización del curso "Get Started with Databricks for Data Engineering" o una comprensión sólida de la Databricks Data Intelligence Platform.
• Comprensión básica de temas como la navegación por un Databricks Workspace, Apache Spark, Delta Lake, la arquitectura Medallion y Unity Catalog.
• Familiaridad con Python/PySpark.
• Experiencia en la escritura de consultas SQL de nivel intermedio.
3. Build Data Pipelines with Apache Spark Declarative Pipelines
• Comprensión básica de la Databricks Data Intelligence Platform, incluidos los Databricks Workspaces, Apache Spark, Delta Lake, la arquitectura Medallion, Lakeflow Jobs y Unity Catalog.
• Experiencia en la ingesta de datos sin procesar en Delta tables, incluido el uso de la función SQL read_files para cargar formatos como CSV, JSON, TXT y Parquet.
• Dominio de la transformación de datos mediante SQL, incluida la escritura de consultas de nivel intermedio y una comprensión básica de los joins de SQL.
• Comprensión de los conceptos de ETL y de los flujos de trabajo de batch/streaming.
4. DevOps Essentials for Data Engineering
• Conocimiento competente de la plataforma Databricks, incluida experiencia con Databricks Workspaces, Apache Spark, Delta Lake y la arquitectura Medallion, Unity Catalog, Delta Live Tables y Workflows. También se requiere una comprensión básica del control de versiones con Git.
• Experiencia en la ingesta y transformación de datos, con dominio de PySpark para el procesamiento de datos y las manipulaciones de DataFrame. Además, los candidatos deben tener experiencia en la escritura de consultas SQL de nivel intermedio para el análisis y la transformación de datos.
• Conocimiento de programación en Python, con dominio de la escritura de código Python de nivel intermedio, incluida la capacidad de diseñar e implementar funciones y clases. Los usuarios también deben ser competentes en la creación, importación y utilización eficaz de paquetes de Python.
Outline
1. Data Ingestion with Lakeflow Connect
• Data Engineering en Databricks
• Exploración del entorno de lab
• Ingesta de datos desde el cloud storage
• Demostración - Ingesta de datos con CREATE TABLE AS y COPY INTO
• Demostración - Crear streaming tables con SQL usando Auto Loader
• Agregar columnas de metadatos en la ingesta
• Demostración - Agregar columnas de metadatos durante la ingesta
• Trabajar con la columna Rescued Data
• Demostración - Gestionar la ingesta de CSV con la columna Rescued Data
• Lab - Crear Bronze tables a partir de archivos CSV
• Ingesta de datos semiestructurados: JSON
• Demostración - Ingerir archivos JSON con Databricks
• Lab - Crear Bronze tables a partir de archivos JSON
• Descripción general de la ingesta de datos empresariales
• Demostración - Ingesta de datos empresariales con LakeFlow Connect
• Funciones adicionales e ingesta en Delta Tables existentes
• Demostración - BONUS - Ingesta de datos con MERGE INTO
2. Deploy Workloads with Lakeflow Jobs
• Introducción al Data Engineering en Databricks
• Componentes esenciales de Lakeflow Jobs
• Descripción general del proyecto del curso
• Demostración: Crear un job usando la interfaz de Lakeflow Jobs
• Lab: Cree su primer job
• Creación y programación de jobs
• Demostración: Automatizar cargas de trabajo con programación y disparadores
• Tarea condicional e iterativa
• Demostración: Crear cargas de trabajo dinámicas con tareas avanzadas
• Lab: Agregar una tarea If-Else y automatizar su job
• Gestión de fallos de tareas y monitoreo del rendimiento de los jobs
• Demostración: Monitorear y reparar tareas
• Lakeflow Jobs en producción y prácticas recomendadas
• LAB DE BONUS: Orquestación modular
3. Build Data Pipelines with Apache Spark Declarative Pipelines
• Introducción al Data Engineering en Databricks
• Demostración: Configuración del curso y creación de un pipeline
• Descripción general del proyecto del curso y de los tipos de dataset
• Desarrollo simplificado de pipelines y configuraciones comunes de pipeline
• Demostración: Desarrollar un pipeline simple
• Garantizar la calidad de los datos con Expectations
• Demostración: Agregar Expectations de calidad de datos
• Lab: Crear un pipeline
• Streaming joins y deployment de pipelines a producción
• Demostración: Hacer el deployment de un pipeline a producción
• Descripción general del Change Data Capture (CDC)
• Demostración: Change Data Capture con AUTO CDC y SCD TYPE 1
• Lab de bonus: AUTO CDC INTO con SCD Type 1
4. DevOps Essentials for Data Engineering
Continuous Integration (CI)
• Introducción a las prácticas recomendadas de ingeniería de software (SWE)
• Introducción a la modularización del código PySpark
• Demostración: Modularizar el código PySpark - OBLIGATORIO
• Lab: Modularizar el código PySpark
• Fundamentos de DevOps
• El papel de CI y CD en DevOps
• Planificación del proyecto
• Demostración: Exploración de la configuración del proyecto
• Introducción a las pruebas unitarias para PySpark
• Demostración: Crear y ejecutar pruebas unitarias
• Lab: Crear y ejecutar pruebas unitarias
• Ejecutar pruebas de integración con SDP y Jobs
• Demostración: Realizar pruebas de integración
• Descripción general del control de versiones con Git
• Lab: Control de versiones con Databricks Git Folders y GitHub
Continuous Deployment (CD)
• Descripción general del deployment de activos de Databricks
• Demostración: Hacer el deployment de los activos de Databricks
Inscripción a clases públicas
Si su empresa ha adquirido créditos de servicio (Success Credits) o cuenta con una suscripción de aprendizaje, por favor complete el formulario de Solicitud de Capacitación. De lo contrario, puede registrarse a continuación.
Solicitud de clase privada
Si su empresa está interesada en capacitación privada, envíe una solicitud.
Registration options
Databricks ofrece modalidades de aprendizaje para acompa ñarlo en todo su recorrido.
A tu propio ritmo
Rutas de aprendizaje personalizadas para roles y trayectorias profesionales de datos, analítica e IA, con videos a pedido.
Regístrese ahoraInstruido por expertos
Cursos públicos y privados impartidos por instructores expertos en sesiones de medio día o dos días.
Regístrese ahoraAprendizaje combinado (Blended Learning)
Sesiones semanales dirigidas por un instructor, junto con opciones a tu propio ritmo, para todos los estilos de aprendizaje, optimizando la finalización y la retención del conocimiento. Visite la pestaña “Catálogo de suscripciones” para comprar.
Comprar ahoraSkills@Scale
Oferta de capacitación integral para clientes a gran escala que incluye elementos para todos los estilos de aprendizaje. Consulte con su ejecutivo de cuenta para obtener más detalles.

