Ir al contenido principal

Building ETL Pipelines with SQL - Spanish

Este curso enseña cómo construir pipelines ETL listos para producción utilizando SQL puro en la Plataforma de Inteligencia de Datos de Databricks. Los estudiantes aprenden Streaming Tables con Auto Loader para la ingesta incremental, Materialized Views con refrescar incremental para transformaciones de Plata a Oro, AUTO CDC (FLOW AUTO CDC) para la gestión declarativa de dimensiones SCD Tipo 1 y Tipo 2, y Declarative Pipelines de Apache Spark (SDP) para agrupar estos objetos en pipelines multi-tabla de producción con expectativas de calidad de datos, tablas PRIVATE y monitoreo unificado. El curso sigue un dataset minorista realista a través de la Arquitectura de Medallas (Bronce → Plata → Oro). La orquestación con Lakeflow Jobs está disponible como módulo adicional.


Nota: Databricks Academy está pasando a un formato basado en cuadernos para las sesiones presenciales en el entorno de Databricks, dejando de utilizar presentaciones de diapositivas para las clases. Puedes acceder a los cuadernos de las clases en el entorno de laboratorio de Vocareum.

Skill Level
Associate
Duration
4h
Prerequisites

El contenido fue desarrollado para participantes con estas habilidades/conocimientos/capacidades:

• Navegación por el workspace de Databricks (barra lateral, Catalog Explorer, Editor SQL)

• Conceptos básicos de Unity Catalog (catálogos, esquemas, tablas, volúmenes)

• SQL intermedio (SELECT, JOIN, GROUP BY, CAST, COALESCE, CREATE TABLE)

• Conceptos de almacenamiento de datos (tablas de hechos/dimensiones, esquemas en estrella, Arquitectura de Medallas)

• Comprensión básica de los flujos de trabajo ETL

Outline

SQL ETL on Databricks

• SQL ETL en Databricks: El panorama general

• Demo: Exploración del Course Dataset y el Editor SQL

• Laboratorio: Uso del Editor SQL y Genie Code


Tablas de transmisión y vistas materializadas

• Creación de SQL ETL Pipelines

• Demo: Construcción de un Pipeline de Bronce a Plata

• Laboratorio: Construcción de un Pipeline de Retroalimentación de Clientes


Auto CDC

• AUTO CDC Actualizaciones de Dimensiones por Transmisión

• Demo: Creación de Slowly Changing Dimensions con AUTO CDC

• Laboratorio: Creación de Slowly Changing Dimensions


Creación de Pipelines con Spark Declarative Pipelines

• De SQL independiente a Pipelines de producción

• Demo: Creación de un Pipeline SDP en el Editor de Múltiples Archivos


(Bonus) Orquestación con Lakeflow Jobs

• Orquestación de SQL Pipelines con Lakeflow Jobs

• Demo: Creación de un Trabajo de LakeFlow para el ETL Pipeline

• Laboratorio: Orquestación de SQL Pipelines con Lakeflow Jobs

Inscripción a clases públicas

Si su empresa ha adquirido créditos de servicio (Success Credits) o cuenta con una suscripción de aprendizaje, por favor complete el formulario de Solicitud de Capacitación. De lo contrario, puede registrarse a continuación.

Solicitud de clase privada

Si su empresa está interesada en capacitación privada, envíe una solicitud.

Ver todas nuestras opciones de inscripción

Registration options

Databricks ofrece modalidades de aprendizaje para acompañarlo en todo su recorrido.

Runtime

A tu propio ritmo

Rutas de aprendizaje personalizadas para roles y trayectorias profesionales de datos, analítica e IA, con videos a pedido.

Regístrese ahora

Instructors

Instruido por expertos

Cursos públicos y privados impartidos por instructores expertos en sesiones de medio día o dos días.

Regístrese ahora

Learning

Aprendizaje combinado (Blended Learning)

Sesiones semanales dirigidas por un instructor, junto con opciones a tu propio ritmo, para todos los estilos de aprendizaje, optimizando la finalización y la retención del conocimiento. Visite la pestaña “Catálogo de suscripciones” para comprar.

Comprar ahora

Scale

Skills@Scale

Oferta de capacitación integral para clientes a gran escala que incluye elementos para todos los estilos de aprendizaje. Consulte con su ejecutivo de cuenta para obtener más detalles.

Próximas clases públicas

Apache Spark Programming with Databricks - Spanish

Este es un curso introductorio que sirve como un punto de entrada adecuado para aprender Apache Spark Programming with Databricks.

A continuación, describimos cada uno de los cuatro módulos de cuatro horas incluidos en este curso.

Nota: Databricks Academy está pasando a un formato basado en cuadernos para las sesiones presenciales en el entorno de Databricks, dejando de utilizar presentaciones de diapositivas para las clases. Puedes acceder a los cuadernos de las clases en el entorno de laboratorio de Vocareum.

Introduction to Apache Spark

Este curso, diseñado para principiantes, cubre los fundamentos de Apache Spark para el procesamiento de datos a gran escala. Explorarás la arquitectura distribuida de Spark, dominarás la API de DataFrame y aprenderás a leer, escribir y procesar datos usando Python. A través de ejercicios prácticos, desarrollarás las habilidades necesarias para ejecutar transformaciones y acciones de Spark de manera eficiente.

Developing Applications with Apache Spark

Domina el procesamiento de datos escalable con Apache Spark en este curso. Aprende a construir Pipelines ETL eficientes, realizar analíticas avanzadas y optimizar transformaciones de datos distribuidas utilizando la DataFrame API de Spark. Explora agrupaciones, agregaciones, joins, operaciones de conjuntos y funciones de ventana. Trabaja con tipos de datos complejos como arrays, maps y structs mientras aplicas las mejores prácticas para la optimización del rendimiento.

Stream Processing and Analysis with Apache Spark

Este curso guía a los estudiantes sobre cómo desarrollar aplicaciones de procesamiento de transmisión escalables y tolerantes a fallos utilizando la API de Spark Structured Streaming en Databricks.

Monitoring and Optimizing Apache Spark Workloads on Databricks

Este curso cubre los componentes principales de la Plataforma de Databricks y Apache Spark con Delta Lake, con enfoque en la arquitectura Lakehouse, Unity Catalog y técnicas de Gestión de datos como Transacciones ACID y mantenimiento de tablas. Además, enseña a los estudiantes cómo optimizar el rendimiento de las consultas mediante particionamiento, shuffles y herramientas de ajuste, al mismo tiempo que utilizan el Spark UI para monitorear aplicaciones y resolver cuellos de botella.

Languages Available: English | 日本語 | 한국어

Paid
16h
Lab
instructor-led
Associate

¿Preguntas?

Si tiene alguna pregunta, consulte nuestra página de Preguntas frecuentes (FAQ).