Ir para o conteúdo principal

Databricks Labs

Os Databricks Labs são projetos criados pela equipe de campo para ajudar você a colocar seus casos de uso em produção mais rapidamente

Node

dqx

DQX

Verificação simplificada da qualidade de dados em escala para cargas de trabalho PySpark em DataFrames de transmissão e padrão.

Fontes do GitHub →

Documentação

Kasal

sdp-meta

Um framework orientado por metadados para Lakeflow Spark Declarative Pipelines. Defina pipelines Bronze e Silver em um arquivo de integração JSON ou YAML — um único pipeline genérico lê a especificação resultante em Runtime e cria o gráfico de processamento completo, para que um único engenheiro de dados possa gerenciar milhares de tabelas sem escrever novo código de pipeline. Disponível via Bundles, CLI, um App para navegador e um servidor MCP para configuração assistida por IA.

Fontes do Github →

Documentação

Entrevista com o autor →

Lakebridge

GeoBrix

O GeoBrix oferece processamento espacial de alto desempenho que complementa os recursos espaciais nativos do Databricks — tipos GEOMETRY/GEOGRAPHY, funções ST_* e H3. Ele estende o Lakehouse com processamento raster avançado, geração de tiles vetoriais e raster, ferramentas de geometria aprimoradas e Grades Globais Discretas adicionais, como Quadbin e a British National Grid. Sua camada leve é executada sem atritos em pipelines do Databricks Serverless e do LakeFlow Pipelines, e um conjunto de leitores e gravadores especializados adiciona manipulação específica de formato para tipos de arquivos geoespaciais comuns.

Código-fonte no Github →

Documentação

blogs →

Outros projetos

Kasal

Kasal é uma forma interativa e low-code de criar e implantar Agentes de AI na plataforma Databricks.

Código-fonte no Github →
Documentação →

Lakebridge

Lakebridge é a plataforma de migração da Databricks, projetada para fornecer às empresas uma solução abrangente e de ponta a ponta para modernizar data warehouses e sistemas de ETL legados. O Lakebridge oferece suporte a uma ampla variedade de plataformas de origem — incluindo Teradata, Oracle, Snowflake, SQL Server, DataStage e outras — e automatiza todas as etapas do processo de migração, desde a descoberta e avaliação até a conversão de código, movimentação de dados e validação, garantindo uma transição rápida e de baixo risco para organizações que buscam liberar a inovação e a eficiência em seu patrimônio de dados.

Fontes do GitHub →
Documentação →
Blog →

Impulse

Impulse é uma biblioteca de analítica baseada em Python, projetada para o processamento de dados de medição de séries temporais em grande escala. Desenvolvido em Apache Spark e Delta Lake, ele permite o processamento distribuído de dados de sensores em escala de petabyte de testes automotivos, IoT industrial e outros domínios com uso intensivo de medições.

Código-fonte no Github →
Documentação →

OntoBricks

OntoBricks é uma aplicação web que transforma tabelas do Databricks em um visualizador de gráfico materializado. Permite criar ontologias (OWL), mapeá-las para tabelas do Unity Catalog via R2RML, materializar triplas em um armazenamento de triplas baseado em Delta e um mecanismo de grafo Lakebase Postgres, raciocinar sobre o grafo (OWL 2 RL, SWRL, SHACL) e consultá-lo por meio de uma API GraphQL gerada automaticamente. O pipeline inteiro — da importação de metadados a um visualizador de gráfico consultável — pode ser executado em quatro cliques usando automação alimentada por LLM.

Fontes do Github →
Documentação →

coda

Execute Claude Code, Codex, Gemini CLI, Hermes Agent e OpenCode em seu navegador — sem necessidade de configuração, conectado ao seu workspace do Databricks.

Fontes do GitHub →
Documentação →

VibeScaler

Colabore com sua equipe para definir o que é um bom comportamento de agente e, em seguida, transforme esse julgamento em um avaliador automatizado que opera em escala.

Fontes do GitHub →
Documentação →

Lakemeter

Estime os custos de workload do Databricks em minutos — com premissas transparentes que você pode analisar, compartilhar e exportar.

Fontes do Github →
Documentação →

Ontos

O Ontos fornece às equipes corporativas as ferramentas para organizar, governar e entregar produtos de dados de alta qualidade, seguindo os princípios de Data Mesh e os padrões do setor, como ODCS (Open Data Contract Standard) e ODPS (Open Data Product Specification).

Fontes do GitHub →
Documentação →
Marketplace →

Databricks MCP

Uma coleção de servidores MCP para ajudar agentes de IA a buscar dados corporativos do Databricks e automatizar ações comuns de desenvolvedor no Databricks.

Fontes do Github →

App de agente conversacional

Aplicativo com uma interface de chat com tecnologia das APIs de conversação do Databricks Genie, criado especificamente para ser executado como um Databricks App.

Fontes do Github →

Aplicativo de Chatbot Assistente de Conhecimento

Exemplo de aplicativo de chatbot do Databricks Knowledge Assistant.

Fontes do Github →

Aplicativo de Registro de Recurso

O aplicativo oferece uma interface fácil de usar para explorar os recursos existentes no Unity Catalog. Além disso, os usuários podem gerar código para criar especificações de recursos e conjuntos de treinamento para treinar modelos de machine learning e implantar recursos como Feature Serving Endpoints.

Código-fonte no Github →

Smolder

O Smolder fornece uma fonte de dados do Apache Spark™ SQL para carregar dados de EHR de formatos de mensagem HL7v2. Além disso, o Smolder fornece funções auxiliares que podem ser usadas em um DataFrame do Spark SQL para analisar o texto da mensagem HL7 e extrair segmentos, campos e subcampos de uma mensagem.

Fontes do Github →
Saiba mais →

Gerador de Dados

Gere dados relevantes rapidamente para seus projetos. O gerador de dados do Databricks pode ser usado para gerar grandes conjuntos de dados simulados/sintéticos para testes, POCs e outros usos

Fontes do Github →
Saiba mais →

DeltaOMS

Coleta centralizada de logs de transações do Delta para análise de metadados e métricas operacionais no seu Lakehouse.

Fontes do Github →
Saiba mais →

Integração com Splunk

Add-on para Splunk, um app que permite que usuários do Splunk Enterprise e do Splunk Cloud executem consultas e ações, como executar notebooks e jobs, no Databricks.

Fontes do Github →
Saiba mais →

DiscoverX

O DiscoverX automatiza tarefas de administração que exigem a inspeção ou aplicação de operações a um grande número de ativos do Lakehouse.

Fontes do Github →

brickster

{brickster} é o kit de ferramentas R para Databricks, que inclui:

  • Wrappers para as APIs da Databricks (p. ex., db_cluster_list, db_volume_read)
  • Navegue pelos ativos do workspace pelo Painel de Conexões do RStudio (open_workspace())
  • Expõe o databricks-sql-connector via {reticulate} (documentação)
  • REPL interativo do Databricks

Fontes do Github →
Documentação →
Blog →

Tempo

O objetivo deste projeto é fornecer uma API para manipulação de séries temporais sobre o Apache Spark™. A funcionalidade inclui criação de features usando valores de tempo defasados, estatísticas móveis (mean, avg, sum, count, etc.), junções AS OF, subamostragem e interpolação. Isso foi testado em escala de TB de dados históricos.

Fontes do GitHub →
Documentação →
Webinar →

Plugin PyLint

Este plugin estende o PyLint com verificações para erros e problemas comuns em código Python, especificamente no ambiente Databricks.

Fontes do Github →
Documentação →

PyTester

O PyTester é uma forma poderosa de gerenciar a configuração e a desmontagem de testes em Python. Esta biblioteca fornece um conjunto de fixtures para ajudar você a escrever testes de integração para o Databricks.

Fontes do Github →
Documentação →

Conector Java do Delta Sharing

O conector Java segue o protocolo Delta Sharing para ler tabelas compartilhadas de um Servidor Delta Sharing. Para reduzir e limitar ainda mais os custos de egresso do lado do Provedor de Dados, implementamos um cache persistente para reduzir e limitar os custos de egresso do lado do Provedor de Dados, removendo quaisquer leituras desnecessárias.

Fontes do GitHub →
Documentação →

UCX

O UCX é um kit de ferramentas para habilitar o Unity Catalog (UC) no seu workspace do Databricks. O UCX fornece comandos e fluxos de trabalho para migrar tabelas e visualizações para o UC. O UCX permite reescrever dashboards, jobs e notebooks para usar os ativos de dados migrados no UC. E há muitos outros recursos.

Fontes do GitHub →
Documentação →
Blog →

migrar-acls-de-ip

Recrie a lista de acesso IP existente de um workspace do Databricks como uma política de ingresso baseada em contexto (CBI) por meio de uma CLI única e focada.

Fontes do GitHub →

Firefly

Um aplicativo Next.js que fornece um frontend personalizado para o Databricks com múltiplas estratégias de autenticação e aplicativos Databricks incorporados.

Fontes do Github →
Documentação →

Observe que todos os projetos no https://github.com/databrickslabs A account é fornecida apenas para sua exploração e não tem suporte formal da Databricks com acordos de nível de serviço (SLAs). Eles são fornecidos COMO ESTÃO e não oferecemos garantias de nenhum tipo.  Quaisquer problemas descobertos pelo uso desses projetos podem ser registrados como GitHub Issues no repo. Eles serão analisados conforme o tempo permitir, mas não há SLAs formais para o suporte do GitHub.