Ir al contenido principal

Build Data Pipelines with Apache Spark Declarative Pipelines - Spanish

Este curso introduce a los usuarios a los conceptos y habilidades esenciales necesarios para construir pipelines de datos utilizando Apache Spark™ Declarative Pipelines (SDP) en Databricks para la ingesta y el procesamiento incremental en Batch o transmisión a través de múltiples tablas de transmisión y vistas materializadas. Diseñado para ingenieros de datos nuevos en Spark Declarative Pipelines, el curso ofrece una visión general completa de los componentes principales, como el procesamiento incremental de datos, las tablas de transmisión, las vistas materializadas y las vistas temporales, destacando sus propósitos específicos y diferencias.


Los temas tratados incluyen:

• Desarrollo y depuración de pipelines ETL con el editor de múltiples archivos en Spark Declarative Pipelines usando SQL (con ejemplos de código en Python)

• Cómo Spark Declarative Pipelines realiza el seguimiento de las dependencias de datos en un pipeline a través del grafo del pipeline

• Configuración de recursos de compute del pipeline, activos de datos, modos de Trigger y otras opciones avanzadas


A continuación, el curso presenta las expectativas de calidad de datos en Spark Declarative Pipelines, guiando a los usuarios a través del proceso de integración de expectativas en los pipelines para validar y aplicar la Integridad de los datos. Los estudiantes explorarán cómo poner un pipeline en producción, incluyendo las opciones de programación y la habilitación del registro de eventos del pipeline para monitorear el rendimiento y el estado del pipeline.


Por último, el curso explica cómo implementar Change Data Capture (CDC) utilizando la sintaxis AUTO CDC INTO dentro de Spark Declarative Pipelines para administrar slowly changing dimensions (SCD Tipo 1 y Tipo 2), preparando a los usuarios para integrar CDC en sus propios pipelines.


Nota: Databricks Academy está migrando a un formato basado en notebooks para las sesiones en el aula dentro del entorno de Databricks, y dejará de usar diapositivas para las clases. Puede acceder a los notebooks de las clases en el entorno de lab de Vocareum.

Skill Level
Associate
Duration
4h
Prerequisites

En este curso, el contenido se desarrolló para participantes con estas habilidades/conocimientos/aptitudes:

• Conocimiento básico de la Plataforma de Inteligencia de Datos de Databricks, incluyendo Databricks Workspaces, Apache Spark, Delta Lake, la Arquitectura de Medallas, Lakeflow Jobs y Unity Catalog.

• Experiencia en la ingesta de Datos sin procesar en tablas Delta, incluyendo el uso de la función SQL read_files para cargar formatos como CSV, JSON, TXT y Parquet.

• Dominio en la transformación de datos mediante SQL, incluyendo la escritura de consultas de nivel intermedio y un conocimiento básico de los joins de SQL.

• Comprensión de los conceptos ETL y de los flujos de trabajo de Batch/transmisión.

Outline

• Introducción a la Ingeniería de datos en Databricks

• Demo - Configuración del curso y creación de un Pipeline

• Descripción general del proyecto del curso y tipos de dataset

• Simplified Pipeline Development and Common Pipeline Settings

• Demo - Developing a Simple Pipeline

• Garantizar la calidad de los datos con Expectations

• Demo - Añadir Expectativas de Calidad de Datos

• Lab - Create a Pipeline

• Transmisión de Joins y Despliegue de Pipelines en Producción

• Demo - Implementación de un Pipeline en producción

• Descripción general de Change Data Capture (CDC)

• Demo - Change Data Capture con AUTO CDC con SCD TYPE 1

• Resumen y Próximos Pasos

• Bonus Lab - AUTO CDC INTO with SCD Type 1

Inscripción a clases públicas

Si su empresa ha adquirido créditos de servicio (Success Credits) o cuenta con una suscripción de aprendizaje, por favor complete el formulario de Solicitud de Capacitación. De lo contrario, puede registrarse a continuación.

Solicitud de clase privada

Si su empresa está interesada en capacitación privada, envíe una solicitud.

Ver todas nuestras opciones de inscripción

Registration options

Databricks ofrece modalidades de aprendizaje para acompañarlo en todo su recorrido.

Runtime

A tu propio ritmo

Rutas de aprendizaje personalizadas para roles y trayectorias profesionales de datos, analítica e IA, con videos a pedido.

Regístrese ahora

Instructors

Instruido por expertos

Cursos públicos y privados impartidos por instructores expertos en sesiones de medio día o dos días.

Regístrese ahora

Learning

Aprendizaje combinado (Blended Learning)

Sesiones semanales dirigidas por un instructor, junto con opciones a tu propio ritmo, para todos los estilos de aprendizaje, optimizando la finalización y la retención del conocimiento. Visite la pestaña “Catálogo de suscripciones” para comprar.

Comprar ahora

Scale

Skills@Scale

Oferta de capacitación integral para clientes a gran escala que incluye elementos para todos los estilos de aprendizaje. Consulte con su ejecutivo de cuenta para obtener más detalles.

Próximas clases públicas

¿Preguntas?

Si tiene alguna pregunta, consulte nuestra página de Preguntas frecuentes (FAQ).