Ir al contenido principal

Data Ingestion with Lakeflow Connect - Spanish

Este curso ofrece una introducción completa a LakeFlow Connect, una solución escalable y simplificada para la ingesta de datos en Databricks desde una amplia variedad de fuentes. Comenzarás explorando los diferentes tipos de conectores de LakeFlow Connect (Standard y Managed) y aprenderás diversas técnicas de ingesta de datos, incluyendo ingesta Batch, incremental Batch y por transmisión. También revisarás los beneficios clave del uso de la Delta table y la Arquitectura de Medallas.


A continuación, desarrollarás habilidades prácticas para ingestar datos desde almacenamiento de objetos en la nube utilizando los conectores estándar de LakeFlow Connect. Esto incluye trabajar con métodos como CREATE TABLE AS SELECT (CTAS), COPY INTO y Auto Loader, con énfasis en los beneficios y consideraciones de cada enfoque. También aprenderás cómo agregar columnas de metadatos a tus tablas de nivel Bronce durante la ingesta en la Plataforma de Inteligencia de Datos de Databricks. El curso también cubre cómo manejar registros que no coinciden con el esquema de tu tabla utilizando la columna de datos rescatados, junto con estrategias para gestionar y analizar estos datos. Además, explorarás técnicas para ingestar y aplanar datos JSON semiestructurados.


Posteriormente, explorarás cómo realizar la ingesta de datos a nivel empresarial utilizando los conectores administrados de LakeFlow Connect para incorporar datos de bases de datos y aplicaciones Software-as-a-Service (SaaS). El curso también presenta Partner Connect como una opción para integrar herramientas de socios en tus cargas de trabajo de ingesta.


Finalmente, el curso concluye con estrategias alternativas de ingesta, incluyendo operaciones MERGE INTO y el aprovechamiento de Databricks Marketplace, proporcionándote una base sólida para dar soporte a casos de uso modernos de Ingeniería de datos.


Nota: Databricks Academy está realizando la transición a un formato basado en notebooks para las sesiones en el aula dentro del entorno de Databricks, descontinuando el uso de presentaciones de diapositivas para las clases. Puede acceder a los notebooks de las clases en el entorno de laboratorio de Vocareum.

Skill Level
Associate
Duration
4h
Prerequisites

• Comprensión básica de la Plataforma de Inteligencia de Datos de Databricks, incluyendo Databricks Workspaces, Apache Spark, Delta Lake, la Arquitectura de Medallas y Unity Catalog.

• Comprensión básica de los flujos de trabajo de ingesta de datos (Batch, transmisión, incremental) y los principios generales de ETL

• Experiencia trabajando con varios formatos de archivo (p. ej., Parquet, CSV, JSON, TXT).

• Dominio de SQL y Python.

• Familiaridad con la ejecución de código en Databricks Notebooks.

Outline

• Data Engineering en Databricks

• Exploración del entorno de laboratorio

• Ingesta de datos desde el almacenamiento en la nube

• Demo - Ingesta de datos con CREATE TABLE AS y COPY INTO

• Demo - Creación de streaming tables con SQL usando Auto Loader

• Adición de columnas de metadatos durante la ingesta

• Demo - Adición de columnas de metadatos durante la ingesta

• Trabajo con la columna Rescued Data

• Demo - Manejo de la ingesta de CSV con la columna Rescued Data

• Lab - Creación de tablas Bronze a partir de archivos CSV

• Ingesta de datos semiestructurados: JSON

• Demo - Ingesta de archivos JSON con Databricks

• Lab - Creación de tablas Bronze a partir de archivos JSON

• Descripción general de la ingesta de datos empresariales

• Demo - Ingesta de datos empresariales con LakeFlow Connect

• Funcionalidades adicionales e ingesta en Delta Tables existentes

• Demo - BONUS - Ingesta de datos con MERGE INTO

Inscripción a clases públicas

Si su empresa ha adquirido créditos de servicio (Success Credits) o cuenta con una suscripción de aprendizaje, por favor complete el formulario de Solicitud de Capacitación. De lo contrario, puede registrarse a continuación.

Solicitud de clase privada

Si su empresa está interesada en capacitación privada, envíe una solicitud.

Ver todas nuestras opciones de inscripción

Registration options

Databricks ofrece modalidades de aprendizaje para acompañarlo en todo su recorrido.

Runtime

A tu propio ritmo

Rutas de aprendizaje personalizadas para roles y trayectorias profesionales de datos, analítica e IA, con videos a pedido.

Regístrese ahora

Instructors

Instruido por expertos

Cursos públicos y privados impartidos por instructores expertos en sesiones de medio día o dos días.

Regístrese ahora

Learning

Aprendizaje combinado (Blended Learning)

Sesiones semanales dirigidas por un instructor, junto con opciones a tu propio ritmo, para todos los estilos de aprendizaje, optimizando la finalización y la retención del conocimiento. Visite la pestaña “Catálogo de suscripciones” para comprar.

Comprar ahora

Scale

Skills@Scale

Oferta de capacitación integral para clientes a gran escala que incluye elementos para todos los estilos de aprendizaje. Consulte con su ejecutivo de cuenta para obtener más detalles.

Próximas clases públicas

Automated Deployment with Declarative Automation Bundles - Spanish

Este curso ofrece una revisión exhaustiva de los principios de DevOps y su aplicación a proyectos de Databricks. Comienza con una descripción general de los conceptos fundamentales de DevOps, DataOps, integración continua (CI), despliegue continuo (CD) y pruebas, y explora cómo estos principios pueden aplicarse a los Pipelines de Ingeniería de datos.

El curso se centra luego en el despliegue continuo dentro del proceso de CI/CD, examinando herramientas como la REST API, el SDK y el CLI de Databricks para el despliegue de proyectos. Aprenderás sobre los Declarative Automation Bundles (DABs) y cómo encajan en el proceso de CI/CD. Profundizarás en sus componentes clave, la estructura de carpetas y cómo agilizan el despliegue en diversos entornos de destino en Databricks. También aprenderás a añadir variables, modificar, validar, desplegar y ejecutar Declarative Automation Bundles para múltiples entornos con diferentes configuraciones mediante el CLI de Databricks.

Finalmente, el curso presenta Visual Studio Code como Entorno de Desarrollo Interactivo (IDE) para construir, probar y desplegar Declarative Automation Bundles de forma local, optimizando el proceso de desarrollo. El curso concluye con una introducción a la automatización de Pipelines de despliegue mediante GitHub Actions para mejorar el Flujo de trabajo de CI/CD con Declarative Automation Bundles.

Al finalizar este curso, estarás preparado para automatizar los despliegues de proyectos de Databricks con Declarative Automation Bundles, mejorando la eficiencia mediante las prácticas de DevOps.

Nota: Databricks Academy está pasando a un formato basado en cuadernos para las sesiones presenciales en el entorno de Databricks, dejando de utilizar presentaciones de diapositivas para las clases. Puedes acceder a los cuadernos de las clases en el entorno de laboratorio de Vocareum.

Languages Available: English | 日本語 | Português BR | 한국어

Paid
4h
Lab
instructor-led
Professional

¿Preguntas?

Si tiene alguna pregunta, consulte nuestra página de Preguntas frecuentes (FAQ).