Ir al contenido principal

Advanced Techniques with Apache Spark Declarative Pipelines - Spanish

Este curso explora Declarative Pipelines de Apache Spark de Databricks (SDP) para construir pipelines de transmisión de nivel de producción. Aprenderás patrones de diseño avanzados, aplicación robusta de calidad de datos e integración multiplataforma esenciales para la ingeniería de lakehouse en el mundo real.


A lo largo del curso, profundizarás en técnicas modernas de ingesta de datos y procesamiento, dominando herramientas como liquid clustering para la optimización del diseño y el patrón Multiplex Streaming para eventos con esquemas mixtos. Al finalizar los módulos, sabrás cómo manejar con confianza la evolución del esquema, automatizar change data capture (CDC) y garantizar la integridad de los datos.


A través de clases y demostraciones prácticas, podrás:

• Construir pipelines de múltiples flujos para ingestar datos de múltiples fuentes en una Tabla Bronce unificada.

• Aplicar liquid clustering y Expectativas de Calidad de Datos en las capas Plata y oro.

• Implementar el patrón Multiplex con Iceberg UniForm para el acceso a datos multiplataforma.

• Automatizar el seguimiento del historial SCD Tipo 2 mediante AUTO CDC INTO.

• Diseñar pipelines de cuarentena sin pérdida de datos para auditar y administrar registros no válidos.


Nota: Databricks Academy está pasando a un formato basado en cuadernos para las sesiones presenciales en el entorno de Databricks, dejando de utilizar presentaciones de diapositivas para las clases. Puedes acceder a los cuadernos de las clases en el entorno de laboratorio de Vocareum.


Languages Available: English | 日本語 | Português BR | 한국어

Skill Level
Professional
Duration
4h
Prerequisites

El contenido fue desarrollado para participantes con las siguientes habilidades/conocimientos/competencias:

• Spark Declarative Pipelines — Finalización del curso "Build Data Pipelines with Apache Spark Declarative Pipelines", o familiaridad con CREATE OR REFRESH STREAMING TABLE, CONSTRAINTS y la interfaz de usuario de Pipelines

• Delta Lake Fundamentals — Comprensión de las tablas Delta y cómo Delta gestiona los archivos de datos y los logs de transacciones

• Conceptos de transmisión — Conocimiento del streaming de micro-lotes, checkpointing y procesamiento de tiempo de evento en SDP

• Competencia en SQL — Capacidad para leer y escribir SQL, incluyendo SELECT, JOIN, MERGE, CASE WHEN y funciones de agregación comunes

• Python in Databricks Notebooks — Comodidad con la lectura y ejecución de código Python en Databricks Notebooks

• Unity Catalog Basics — Comprensión de catálogos, esquemas, tablas y volúmenes en Unity Catalog

Outline

Técnicas Avanzadas con Spark Declarative Pipelines:

• Introducción a Multi Flows, Expectation y Liquid Clustering en SDP

• Demo: Multi Flow SDP with Liquid Clustering and Data Quality

• Introducción a la transmisión multiplex, Delta Sinks e Iceberg Reads

• Demo: Transmisión Multiplex SDP con Destinos Delta y Lecturas Iceberg

• Change Data Capture (CDC) Review

• Demo: Automatización de SCD Type 2 con AUTO CDC en Apache Spark Declarative Pipelines

• Verificaciones Avanzadas de Calidad de Datos y Expectativas en SDP

• Demo: Advanced Data Quality Checks and Expectation in SDP

• Laboratorio: Creación de un Pipeline de Comercio electrónico Multi-fuente con SDP

Inscripción a clases públicas

Si su empresa ha adquirido créditos de servicio (Success Credits) o cuenta con una suscripción de aprendizaje, por favor complete el formulario de Solicitud de Capacitación. De lo contrario, puede registrarse a continuación.

Solicitud de clase privada

Si su empresa está interesada en capacitación privada, envíe una solicitud.

Ver todas nuestras opciones de inscripción

Registration options

Databricks ofrece modalidades de aprendizaje para acompañarlo en todo su recorrido.

Runtime

A tu propio ritmo

Rutas de aprendizaje personalizadas para roles y trayectorias profesionales de datos, analítica e IA, con videos a pedido.

Regístrese ahora

Instructors

Instruido por expertos

Cursos públicos y privados impartidos por instructores expertos en sesiones de medio día o dos días.

Regístrese ahora

Learning

Aprendizaje combinado (Blended Learning)

Sesiones semanales dirigidas por un instructor, junto con opciones a tu propio ritmo, para todos los estilos de aprendizaje, optimizando la finalización y la retención del conocimiento. Visite la pestaña “Catálogo de suscripciones” para comprar.

Comprar ahora

Scale

Skills@Scale

Oferta de capacitación integral para clientes a gran escala que incluye elementos para todos los estilos de aprendizaje. Consulte con su ejecutivo de cuenta para obtener más detalles.

Próximas clases públicas

Machine Learning with Databricks - Spanish

¡Le damos la bienvenida a Machine Learning with Databricks!

Este curso es su puerta de entrada para dominar los flujos de trabajo de machine learning en Databricks. Sumérjase en la preparación de datos, el desarrollo de modelos, el despliegue y las operaciones, con la guía de instructores expertos. Aprenda las habilidades esenciales para la exploración de datos, el entrenamiento de modelos y las estrategias de despliegue adaptadas a Databricks. Al finalizar el curso, contará con el conocimiento y la confianza para recorrer todo el ciclo de vida del machine learning en la Plataforma de Databricks, lo que le permitirá crear y desplegar soluciones de machine learning robustas de manera eficiente.

Nota: Databricks Academy está pasando a un formato basado en cuadernos para las sesiones presenciales en el entorno de Databricks, dejando de utilizar presentaciones de diapositivas para las clases. Puedes acceder a los cuadernos de las clases en el entorno de laboratorio de Vocareum.

Data Preparation for Machine Learning

Este curso se centra en los fundamentos de la preparación de datos para machine learning utilizando Databricks. Los participantes aprenderán habilidades esenciales para explorar, limpiar y organizar datos adaptados para aplicaciones tradicionales de machine learning. Los temas clave incluyen visualización de datos, ingeniería de características y estrategias óptimas de almacenamiento de características. A través de ejercicios prácticos, los participantes adquirirán experiencia práctica en la preparación eficiente de conjuntos de datos para machine learning dentro de Databricks. Este curso está diseñado para Científicos de datos de nivel asociado y profesionales de machine learning, así como para personas que buscan mejorar su competencia en la preparación de datos, garantizando una base sólida para el despliegue exitosamente de Modelos de machine learning.

Machine Learning Model Development

Este completo curso ofrece una guía práctica para desarrollar modelos de machine learning tradicionales en Databricks, con énfasis en demostraciones prácticas y flujos de trabajo que utilizan las bibliotecas de ML más populares. Los participantes explorarán técnicas clave de ML, incluidas la regresión y el clustering, a la vez que aprovechan las potentes capacidades de Databricks. El curso abarca la integración de MLflow para el seguimiento de modelos, el Databricks Feature Store para la gestión de features y Optuna para el ajuste de hiperparámetros. Además, los participantes aprenderán a acelerar el desarrollo de modelos con Genie Code, el asistente de codificación impulsado por IA de Databricks que utiliza lenguaje natural, conexiones MCP, instrucciones y habilidades para guiar todo el ciclo de vida del ML. Al finalizar el curso, los alumnos contarán con habilidades prácticas y aplicables para desarrollar, optimizar e implementar modelos de machine learning de forma eficiente en el entorno de Databricks.

Machine Learning Model Deployment

Este curso está diseñado para presentar tres estrategias principales de despliegue de machine learning e ilustrar la implementación de cada estrategia en Databricks. Tras explorar los fundamentos del despliegue de modelos, el curso profundiza en la inferencia Batch, ofreciendo demostraciones prácticas y laboratorios para utilizar un modelo en escenarios de inferencia Batch, junto con consideraciones para la optimización del rendimiento. La segunda parte del curso cubre de manera exhaustiva el despliegue de Pipeline, mientras que el segmento final se centra en el despliegue en tiempo real. Los participantes realizarán demostraciones prácticas y laboratorios, desplegando modelos con Model Serving y utilizando el endpoint de servicio para inferencia en tiempo real.

Machine Learning Operations

Este curso guiará a los participantes a través de una exploración exhaustiva de las operaciones de Modelo de machine learning, con enfoque en MLOps y la gestión del ciclo de vida del modelo. El segmento inicial cubre los componentes esenciales de MLOps y las mejores prácticas, proporcionando a los participantes una base sólida para operacionalizar eficazmente los Modelos de machine learning. En la segunda parte del curso, profundizaremos en los fundamentos del ciclo de vida del modelo, demostrando cómo navegarlo de manera fluida utilizando el Registro de modelos en conjunto con Unity Catalog para una gestión eficiente del modelo. Al finalizar el curso, los participantes habrán adquirido perspectivas prácticas y una comprensión integral de los principios de MLOps, equipados con las habilidades necesarias para desenvolverse en el intrincado panorama de las operaciones de Modelo de machine learning.

Languages Available: English | 日本語 | Português BR | 한국어

Paid
16h
Lab
instructor-led
Associate

¿Preguntas?

Si tiene alguna pregunta, consulte nuestra página de Preguntas frecuentes (FAQ).