Ir al contenido principal

Databricks Labs

¡Databricks Labs son proyectos creados por el equipo de campo para ayudar a los clientes a llevar sus casos de uso a producción más rápido!

Node

dqx

DQX

Verificación simplificada de la calidad de los datos a escala para cargas de trabajo de PySpark en DataFrames de streaming y estándar.

Fuentes de GitHub →

Documentación

Kasal

sdp-meta

Un framework impulsado por metadatos para las canalizaciones declarativas de Lakeflow Spark. Defina canalizaciones Bronze y Silver en un archivo de incorporación JSON o YAML: una única canalización genérica lee la especificación resultante en tiempo de ejecución y construye el grafo de procesamiento completo, de modo que un único ingeniero de datos puede gestionar miles de tablas sin escribir nuevo código de canalización. Disponible a través de Bundles, CLI, una aplicación basada en navegador y un servidor MCP para una configuración asistida por IA.

Fuentes de Github →

Documentación

Entrevista con el autor →

Lakebridge

GeoBrix

GeoBrix ofrece un procesamiento espacial de alto rendimiento que complementa las capacidades espaciales nativas de Databricks: tipos GEOMETRY/GEOGRAPHY, funciones ST_* y H3. Amplía el Lakehouse con procesamiento de ráster avanzado, generación de mosaicos de vectores y rásteres, herramientas de geometría mejoradas y Grillas Globales Discretas adicionales como Quadbin y la British National Grid. Su nivel liviano se ejecuta de manera fluida en Databricks Serverless y en las canalizaciones de Lakeflow, y un conjunto de lectores y escritores especializados agrega un manejo específico de formato para los tipos de archivos geoespaciales comunes.

Fuentes de Github →

Documentación

Blog →

Otros proyectos

Kasal

Kasal es una forma interactiva y de bajo código para crear y desplegar agentes de IA en la plataforma de Databricks.

Fuentes de Github →
Documentación →

Lakebridge

Lakebridge es la plataforma de migración de Databricks, diseñada para proporcionar a las empresas una solución integral de extremo a extremo para modernizar los sistemas ETL y los almacenes de datos heredados. Lakebridge admite una amplia gama de plataformas de origen (entre ellas, Teradata, Oracle, Snowflake, SQL Server, DataStage y más) y automatiza cada etapa del proceso de migración, desde el descubrimiento y la evaluación hasta la conversión de código, el movimiento de datos y la validación, lo que garantiza una transición rápida y de bajo riesgo para las organizaciones que buscan liberar la innovación y la eficiencia en su patrimonio de datos.

Fuentes de GitHub →
Documentación →
Blog →

Impulso

Impulse es una biblioteca analítica basada en Python diseñada para procesar datos de medición de seriales temporales a gran escala. Construido sobre Apache Spark y Delta Lake, permite el procesamiento distribuido de datos de sensores a escala de petabytes procedentes de pruebas automotrices, IoT industrial y otros dominios intensivos en medición.

Fuentes de Github →
Documentación →

OntoBricks

OntoBricks es una aplicación web que transforma las tablas de Databricks en un visor de grafos materializado. Permite diseñar ontologías (OWL), asignarlas a tablas de Unity Catalog a través de R2RML, materializar tripletas en un almacén de tripletas respaldado por Delta y un motor de grafos de Lakebase Postgres, razonar sobre el grafo (OWL 2 RL, SWRL, SHACL) y consultarlo a través de una API de GraphQL autogenerada. Todo el pipeline, desde la importación de metadatos hasta un visor de grafos consultable, puede ejecutarse en cuatro clics mediante la automatización impulsada por LLM.

Fuentes de Github →
Documentación →

coda

Ejecuta Claude Code, Codex, Gemini CLI, Hermes Agent y OpenCode en tu navegador—cero configuración, conectados por cable a tu espacio de trabajo Databricks.

Fuentes de Github →
Documentación →

VibeScaler

Colabore con su equipo para definir cómo es un buen comportamiento del agente y, luego, convierta ese juicio en un calificador automatizado que se ejecute a escala.

Fuentes de GitHub →
Documentación →

Lakemeter

Estime los costos de las cargas de trabajo de Databricks en minutos, con supuestos transparentes que puede revisar, compartir y exportar.

Fuentes de Github →
Documentación →

Ontos

Ontos proporciona a los equipos empresariales las herramientas para organizar, gobernar y entregar productos de datos de alta calidad siguiendo los principios de Data Mesh y los estándares de la industria como ODCS (Open Data Contract Standard) y ODPS (Open Data Product Specification).

Fuentes de GitHub →
Documentación →
Marketplace →

Databricks MCP

Una colección de servidores MCP para ayudar a los agentes de IA a obtener datos empresariales de Databricks y automatizar acciones comunes de desarrollador en Databricks.

Fuentes de GitHub →

Aplicación de agente conversacional

Aplicación con una interfaz de chat impulsada por las APIs de conversación Genie de Databricks, diseñada específicamente para funcionar como una aplicación Databricks.

Fuentes de Github →

Aplicación de chatbot de asistente de conocimiento

Ejemplo de aplicación de chatbot Databricks Knowledge Assistant.

Fuentes de GitHub →

Aplicación de registro de características

La app ofrece una interfaz fácil de usar para explorar las funciones existentes en Unity Catalog. Además, los usuarios pueden generar código para crear especificaciones de características y conjuntos de entrenamiento para entrenar modelos de machine learning y desplegar características como endpoints de servicio de características.

Fuentes de GitHub →

Smolder

Smolder ofrece una fuente de datos SQL de Apache Spark™ para cargar datos de EHR desde formatos de mensaje HL7v2. Además, Smolder ofrece funciones de ayuda que se pueden usar en un DataFrame de Spark SQL para analizar el texto de los mensajes HL7 y para extraer segmentos, campos y subcampos de un mensaje.

Fuentes de Github →
Más información →

Generador de datos

Genera datos relevantes rápidamente para tus proyectos. El generador de datos de Databricks se puede usar para generar grandes conjuntos de datos simulados o sintéticos para pruebas, POC y otros usos.

Fuentes de GitHub →
Más información →

DeltaOMS

Recopilación centralizada del registro de transacciones de Delta para el análisis de metadatos y métricas operativas en tu Lakehouse.

Fuentes de Github →
Más información →

Integración con Splunk

Complemento para Splunk, una app que permite a los usuarios de Splunk Enterprise y Splunk Cloud ejecutar consultas y realizar acciones, como ejecutar notebooks y trabajos, en Databricks.

Fuentes de Github →
Más información →

DiscoverX

DiscoverX automatiza las tareas de administración que requieren inspeccionar o aplicar operaciones a un gran número de activos de Lakehouse.

Fuentes de Github →

brickster

{brickster} es el kit de herramientas de R para Databricks, que incluye lo siguiente:

  • Envoltorios para las API de Databricks (p. ej., db_cluster_list, db_volume_read)
  • Activos del espacio de trabajo del navegador a través del Panel de Conexiones de RStudio (open_workspace())
  • Expone el databricks-sql-connector mediante {reticulate} (docs)
  • Repl de Databricks interactivos

Fuentes de Github →
Documentación →
Blog →

Tempo

El propósito de este proyecto es proporcionar una API para manipular series temporales sobre Apache Spark™. La funcionalidad incluye featurización mediante valores de tiempo rezagados, estadísticas móviles (media, promedio, suma, recuento, etc.), uniones AS OF, submuestreo e interpolación. Esto se ha probado en datos históricos a escala de TB.

Fuentes de GitHub →
Documentación →
Webinar →

PyLint Plugin

Este plugin extiende PyLint con verificaciones para errores y problemas comunes en el código de Python, específicamente en el entorno de Databricks.

Fuentes de Github →
Documentación →

PyTester

PyTester es una forma poderosa de gestionar la configuración y el desmontaje de pruebas en Python. Esta biblioteca proporciona un conjunto de fixtures para ayudarte a escribir pruebas de integración para Databricks.

Fuentes de Github →
Documentación →

Conector de Java de Delta Sharing

El conector de Java sigue el protocolo Delta Sharing para leer tablas compartidas desde un servidor de Delta Sharing. Para reducir y limitar aún más los costos de egreso del lado del proveedor de datos, implementamos una caché persistente a fin de eliminar las lecturas innecesarias.

Fuentes de GitHub →
Documentación →

UCX

UCX es un kit de herramientas para habilitar Unity Catalog (UC) en su espacio de trabajo de Databricks. UCX proporciona comandos y flujos de trabajo para migrar tablas y vistas a UC. UCX permite reescribir dashboards, trabajos y notebooks para usar los activos de datos migrados en UC. Y hay muchas más funciones.

Fuentes de GitHub →
Documentación →
Blog →

migrate-ip-acls

Recrea la lista de acceso IP existente de un espacio de trabajo de Databricks como una política de entrada basada en contexto (CBI) mediante una única CLI enfocada.

Fuentes de GitHub →

Firefly

Una aplicación de Next.js que proporciona un frontend personalizado para Databricks con múltiples estrategias de autenticación y aplicaciones de Databricks integradas.

Fuentes de Github →
Documentación →

Ten en cuenta que todos los proyectos en https://github.com/databrickslabs de la cuenta se proporcionan solo para su exploración y no cuentan con el soporte formal de Databricks con acuerdos de nivel de servicio (SLA). Se proporcionan AS IS y no ofrecemos ningún tipo de garantía.  Los problemas que se descubran al usar estos proyectos se pueden registrar como Issues de GitHub en el repositorio. Se revisarán cuando sea posible, pero no hay SLA formales para el soporte de GitHub.