Databricks Labs
¡Databricks Labs son proyectos creados por el equipo de campo para ayudar a los clientes a llevar sus casos de uso a producción más rápido!
DQX
Verificación simplificada de la calidad de los datos a escala para cargas de trabajo de PySpark en DataFrames de streaming y estándar.
sdp-meta
Un framework impulsado por metadatos para las canalizaciones declarativas de Lakeflow Spark. Defina canalizaciones Bronze y Silver en un archivo de incorporación JSON o YAML: una única canalización genérica lee la especificación resultante en tiempo de ejecución y construye el grafo de procesamiento completo, de modo que un único ingeniero de datos puede gestionar miles de tablas sin escribir nuevo código de canalización. Disponible a través de Bundles, CLI, una aplicación basada en navegador y un servidor MCP para una configuración asistida por IA.
GeoBrix
GeoBrix ofrece un procesamiento espacial de alto rendimiento que complementa las capacidades espaciales nativas de Databricks: tipos GEOMETRY/GEOGRAPHY, funciones ST_* y H3. Amplía el Lakehouse con procesamiento de ráster avanzado, generación de mosaicos de vectores y rásteres, herramientas de geometría mejoradas y Grillas Globales Discretas adicionales como Quadbin y la British National Grid. Su nivel liviano se ejecuta de manera fluida en Databricks Serverless y en las canalizaciones de Lakeflow, y un conjunto de lectores y escritores especializados agrega un manejo específico de formato para los tipos de archivos geoespaciales comunes.
Otros proyectos
Kasal
Kasal es una forma interactiva y de bajo código para crear y desplegar agentes de IA en la plataforma de Databricks.
Lakebridge
Lakebridge es la plataforma de migración de Databricks, diseñada para proporcionar a las empresas una solución integral de extremo a extremo para modernizar los sistemas ETL y los almacenes de datos heredados. Lakebridge admite una amplia gama de plataformas de origen (entre ellas, Teradata, Oracle, Snowflake, SQL Server, DataStage y más) y automatiza cada etapa del proceso de migración, desde el descubrimiento y la evaluación hasta la conversión de código, el movimiento de datos y la validación, lo que garantiza una transición rápida y de bajo riesgo para las organizaciones que buscan liberar la innovación y la eficiencia en su patrimonio de datos.
Impulso
Impulse es una biblioteca analítica basada en Python diseñada para procesar datos de medición de seriales temporales a gran escala. Construido sobre Apache Spark y Delta Lake, permite el procesamiento distribuido de datos de sensores a escala de petabytes procedentes de pruebas automotrices, IoT industrial y otros dominios intensivos en medición.
OntoBricks
OntoBricks es una aplicación web que transforma las tablas de Databricks en un visor de grafos materializado. Permite diseñar ontologías (OWL), asignarlas a tablas de Unity Catalog a través de R2RML, materializar tripletas en un almacén de tripletas respaldado por Delta y un motor de grafos de Lakebase Postgres, razonar sobre el grafo (OWL 2 RL, SWRL, SHACL) y consultarlo a través de una API de GraphQL autogenerada. Todo el pipeline, desde la importación de metadatos hasta un visor de grafos consultable, puede ejecutarse en cuatro clics mediante la automatización impulsada por LLM.
coda
Ejecuta Claude Code, Codex, Gemini CLI, Hermes Agent y OpenCode en tu navegador—cero configuración, conectados por cable a tu espacio de trabajo Databricks.
VibeScaler
Colabore con su equipo para definir cómo es un buen comportamiento del agente y, luego, convierta ese juicio en un calificador automatizado que se ejecute a escala.
Lakemeter
Estime los costos de las cargas de trabajo de Databricks en minutos, con supuestos transparentes que puede revisar, compartir y exportar.
Databricks MCP
Una colección de servidores MCP para ayudar a los agentes de IA a obtener datos empresariales de Databricks y automatizar acciones comunes de desarrollador en Databricks.
Aplicación de agente conversacional
Aplicación con una interfaz de chat impulsada por las APIs de conversación Genie de Databricks, diseñada específicamente para funcionar como una aplicación Databricks.
Aplicación de chatbot de asistente de conocimiento
Ejemplo de aplicación de chatbot Databricks Knowledge Assistant.
Aplicación de registro de características
La app ofrece una interfaz fácil de usar para explorar las funciones existentes en Unity Catalog. Además, los usuarios pueden generar código para crear especificaciones de características y conjuntos de entrenamiento para entrenar modelos de machine learning y desplegar características como endpoints de servicio de características.
Smolder
Smolder ofrece una fuente de datos SQL de Apache Spark™ para cargar datos de EHR desde formatos de mensaje HL7v2. Además, Smolder ofrece funciones de ayuda que se pueden usar en un DataFrame de Spark SQL para analizar el texto de los mensajes HL7 y para extraer segmentos, campos y subcampos de un mensaje.
Generador de datos
Genera datos relevantes rápidamente para tus proyectos. El generador de datos de Databricks se puede usar para generar grandes conjuntos de datos simulados o sintéticos para pruebas, POC y otros usos.
DeltaOMS
Recopilación centralizada del registro de transacciones de Delta para el análisis de metadatos y métricas operativas en tu Lakehouse.
Integración con Splunk
Complemento para Splunk, una app que permite a los usuarios de Splunk Enterprise y Splunk Cloud ejecutar consultas y realizar acciones, como ejecutar notebooks y trabajos, en Databricks.
DiscoverX
DiscoverX automatiza las tareas de administración que requieren inspeccionar o aplicar operaciones a un gran número de activos de Lakehouse.
brickster
{brickster} es el kit de herramientas de R para Databricks, que incluye lo siguiente:
- Envoltorios para las API de Databricks (p. ej., db_cluster_list, db_volume_read)
- Activos del espacio de trabajo del navegador a través del Panel de Conexiones de RStudio (open_workspace())
- Expone el databricks-sql-connector mediante {reticulate} (docs)
- Repl de Databricks interactivos
Tempo
El propósito de este proyecto es proporcionar una API para manipular series temporales sobre Apache Spark™. La funcionalidad incluye featurización mediante valores de tiempo rezagados, estadísticas móviles (media, promedio, suma, recuento, etc.), uniones AS OF, submuestreo e interpolación. Esto se ha probado en datos históricos a escala de TB.
PyLint Plugin
Este plugin extiende PyLint con verificaciones para errores y problemas comunes en el código de Python, específicamente en el entorno de Databricks.
PyTester
PyTester es una forma poderosa de gestionar la configuración y el desmontaje de pruebas en Python. Esta biblioteca proporciona un conjunto de fixtures para ayudarte a escribir pruebas de integración para Databricks.
Conector de Java de Delta Sharing
El conector de Java sigue el protocolo Delta Sharing para leer tablas compartidas desde un servidor de Delta Sharing. Para reducir y limitar aún más los costos de egreso del lado del proveedor de datos, implementamos una caché persistente a fin de eliminar las lecturas innecesarias.
UCX
UCX es un kit de herramientas para habilitar Unity Catalog (UC) en su espacio de trabajo de Databricks. UCX proporciona comandos y flujos de trabajo para migrar tablas y vistas a UC. UCX permite reescribir dashboards, trabajos y notebooks para usar los activos de datos migrados en UC. Y hay muchas más funciones.
migrate-ip-acls
Recrea la lista de acceso IP existente de un espacio de trabajo de Databricks como una política de entrada basada en contexto (CBI) mediante una única CLI enfocada.
Firefly
Una aplicación de Next.js que proporciona un frontend personalizado para Databricks con múltiples estrategias de autenticación y aplicaciones de Databricks integradas.
Ten en cuenta que todos los proyectos en https://github.com/databrickslabs de la cuenta se proporcionan solo para su exploración y no cuentan con el soporte formal de Databricks con acuerdos de nivel de servicio (SLA). Se proporcionan AS IS y no ofrecemos ningún tipo de garantía. Los problemas que se descubran al usar estos proyectos se pueden registrar como Issues de GitHub en el repositorio. Se revisarán cuando sea posible, pero no hay SLA formales para el soporte de GitHub.


