Ir al contenido principal

Build Data Pipelines with Apache Spark Declarative Pipelines - Spanish

Este curso introduce a los usuarios a los conceptos y habilidades esenciales necesarios para construir pipelines de datos utilizando Apache Spark™ Declarative Pipelines (SDP) en Databricks para la ingesta y el procesamiento incremental en Batch o transmisión a través de múltiples tablas de transmisión y vistas materializadas. Diseñado para ingenieros de datos nuevos en Spark Declarative Pipelines, el curso ofrece una visión general completa de los componentes principales, como el procesamiento incremental de datos, las tablas de transmisión, las vistas materializadas y las vistas temporales, destacando sus propósitos específicos y diferencias.


Los temas tratados incluyen:

• Desarrollo y depuración de pipelines ETL con el editor de múltiples archivos en Spark Declarative Pipelines usando SQL (con ejemplos de código en Python)

• Cómo Spark Declarative Pipelines realiza el seguimiento de las dependencias de datos en un pipeline a través del grafo del pipeline

• Configuración de recursos de compute del pipeline, activos de datos, modos de Trigger y otras opciones avanzadas


A continuación, el curso presenta las expectativas de calidad de datos en Spark Declarative Pipelines, guiando a los usuarios a través del proceso de integración de expectativas en los pipelines para validar y aplicar la Integridad de los datos. Los estudiantes explorarán cómo poner un pipeline en producción, incluyendo las opciones de programación y la habilitación del registro de eventos del pipeline para monitorear el rendimiento y el estado del pipeline.


Por último, el curso explica cómo implementar Change Data Capture (CDC) utilizando la sintaxis AUTO CDC INTO dentro de Spark Declarative Pipelines para administrar slowly changing dimensions (SCD Tipo 1 y Tipo 2), preparando a los usuarios para integrar CDC en sus propios pipelines.


Nota: Databricks Academy está migrando a un formato basado en notebooks para las sesiones en el aula dentro del entorno de Databricks, y dejará de usar diapositivas para las clases. Puede acceder a los notebooks de las clases en el entorno de lab de Vocareum.

Skill Level
Associate
Duration
4h
Prerequisites

En este curso, el contenido se desarrolló para participantes con estas habilidades/conocimientos/aptitudes:

• Conocimiento básico de la Plataforma de Inteligencia de Datos de Databricks, incluyendo Databricks Workspaces, Apache Spark, Delta Lake, la Arquitectura de Medallas, Lakeflow Jobs y Unity Catalog.

• Experiencia en la ingesta de Datos sin procesar en tablas Delta, incluyendo el uso de la función SQL read_files para cargar formatos como CSV, JSON, TXT y Parquet.

• Dominio en la transformación de datos mediante SQL, incluyendo la escritura de consultas de nivel intermedio y un conocimiento básico de los joins de SQL.

• Comprensión de los conceptos ETL y de los flujos de trabajo de Batch/transmisión.

Outline

• Introducción a la Ingeniería de datos en Databricks

• Demo - Configuración del curso y creación de un Pipeline

• Descripción general del proyecto del curso y tipos de dataset

• Simplified Pipeline Development and Common Pipeline Settings

• Demo - Developing a Simple Pipeline

• Garantizar la calidad de los datos con Expectations

• Demo - Añadir Expectativas de Calidad de Datos

• Lab - Create a Pipeline

• Transmisión de Joins y Despliegue de Pipelines en Producción

• Demo - Implementación de un Pipeline en producción

• Descripción general de Change Data Capture (CDC)

• Demo - Change Data Capture con AUTO CDC con SCD TYPE 1

• Resumen y Próximos Pasos

• Bonus Lab - AUTO CDC INTO with SCD Type 1

Inscripción a clases públicas

Si su empresa ha adquirido créditos de servicio (Success Credits) o cuenta con una suscripción de aprendizaje, por favor complete el formulario de Solicitud de Capacitación. De lo contrario, puede registrarse a continuación.

Solicitud de clase privada

Si su empresa está interesada en capacitación privada, envíe una solicitud.

Ver todas nuestras opciones de inscripción

Registration options

Databricks ofrece modalidades de aprendizaje para acompañarlo en todo su recorrido.

Runtime

A tu propio ritmo

Rutas de aprendizaje personalizadas para roles y trayectorias profesionales de datos, analítica e IA, con videos a pedido.

Regístrese ahora

Instructors

Instruido por expertos

Cursos públicos y privados impartidos por instructores expertos en sesiones de medio día o dos días.

Regístrese ahora

Learning

Aprendizaje combinado (Blended Learning)

Sesiones semanales dirigidas por un instructor, junto con opciones a tu propio ritmo, para todos los estilos de aprendizaje, optimizando la finalización y la retención del conocimiento. Visite la pestaña “Catálogo de suscripciones” para comprar.

Comprar ahora

Scale

Skills@Scale

Oferta de capacitación integral para clientes a gran escala que incluye elementos para todos los estilos de aprendizaje. Consulte con su ejecutivo de cuenta para obtener más detalles.

Próximas clases públicas

Automated Deployment with Declarative Automation Bundles - Spanish

Este curso ofrece una revisión exhaustiva de los principios de DevOps y su aplicación a proyectos de Databricks. Comienza con una descripción general de los conceptos fundamentales de DevOps, DataOps, integración continua (CI), despliegue continuo (CD) y pruebas, y explora cómo estos principios pueden aplicarse a los Pipelines de Ingeniería de datos.

El curso se centra luego en el despliegue continuo dentro del proceso de CI/CD, examinando herramientas como la REST API, el SDK y el CLI de Databricks para el despliegue de proyectos. Aprenderás sobre los Declarative Automation Bundles (DABs) y cómo encajan en el proceso de CI/CD. Profundizarás en sus componentes clave, la estructura de carpetas y cómo agilizan el despliegue en diversos entornos de destino en Databricks. También aprenderás a añadir variables, modificar, validar, desplegar y ejecutar Declarative Automation Bundles para múltiples entornos con diferentes configuraciones mediante el CLI de Databricks.

Finalmente, el curso presenta Visual Studio Code como Entorno de Desarrollo Interactivo (IDE) para construir, probar y desplegar Declarative Automation Bundles de forma local, optimizando el proceso de desarrollo. El curso concluye con una introducción a la automatización de Pipelines de despliegue mediante GitHub Actions para mejorar el Flujo de trabajo de CI/CD con Declarative Automation Bundles.

Al finalizar este curso, estarás preparado para automatizar los despliegues de proyectos de Databricks con Declarative Automation Bundles, mejorando la eficiencia mediante las prácticas de DevOps.

Nota: Databricks Academy está pasando a un formato basado en cuadernos para las sesiones presenciales en el entorno de Databricks, dejando de utilizar presentaciones de diapositivas para las clases. Puedes acceder a los cuadernos de las clases en el entorno de laboratorio de Vocareum.

Languages Available: English | 日本語 | Português BR | 한국어

Paid
4h
Lab
instructor-led
Professional

Advanced Techniques with Apache Spark Declarative Pipelines - Spanish

Este curso explora Declarative Pipelines de Apache Spark de Databricks (SDP) para construir pipelines de transmisión de nivel de producción. Aprenderás patrones de diseño avanzados, aplicación robusta de calidad de datos e integración multiplataforma esenciales para la ingeniería de lakehouse en el mundo real.

A lo largo del curso, profundizarás en técnicas modernas de ingesta de datos y procesamiento, dominando herramientas como liquid clustering para la optimización del diseño y el patrón Multiplex Streaming para eventos con esquemas mixtos. Al finalizar los módulos, sabrás cómo manejar con confianza la evolución del esquema, automatizar change data capture (CDC) y garantizar la integridad de los datos.

A través de clases y demostraciones prácticas, podrás:

• Construir pipelines de múltiples flujos para ingestar datos de múltiples fuentes en una Tabla Bronce unificada.

• Aplicar liquid clustering y Expectativas de Calidad de Datos en las capas Plata y oro.

• Implementar el patrón Multiplex con Iceberg UniForm para el acceso a datos multiplataforma.

• Automatizar el seguimiento del historial SCD Tipo 2 mediante AUTO CDC INTO.

• Diseñar pipelines de cuarentena sin pérdida de datos para auditar y administrar registros no válidos.

Nota: Databricks Academy está pasando a un formato basado en cuadernos para las sesiones presenciales en el entorno de Databricks, dejando de utilizar presentaciones de diapositivas para las clases. Puedes acceder a los cuadernos de las clases en el entorno de laboratorio de Vocareum.

Languages Available: English | 日本語 | Português BR | 한국어

Paid
4h
Lab
instructor-led
Professional

¿Preguntas?

Si tiene alguna pregunta, consulte nuestra página de Preguntas frecuentes (FAQ).