Passa al contenuto principale

Databricks Labs

I Databricks Labs sono progetti creati sul campo per aiutare i clienti a portare i loro casi d'uso in produzione più velocemente!

Node

dqx

DQX

Controllo semplificato della qualità dei dati su larga scala per carichi di lavoro PySpark su DataFrames standard e di streaming.

Sorgenti GitHub →

Documentazione →

Kasal

sdp-meta

Un framework guidato da metadati per Lakeflow Spark Declarative Pipelines. Definisci le pipeline Bronze e Silver in un file di onboarding JSON o YAML: una singola pipeline generica legge la specifica risultante in fase di esecuzione e costruisce il Graph di elaborazione completo, in modo che un singolo data engineer possa gestire migliaia di tabelle senza scrivere nuovo codice per le pipeline. Disponibile tramite bundle, CLI, un'app basata su browser e un server MCP per la configurazione assistita da AI.

Sorgenti GitHub →

Documentazione →

Intervista con l'autore →

Lakebridge

GeoBrix

GeoBrix offre un'elaborazione spaziale ad alte prestazioni che integra le capacità spaziali native di Databricks: tipi GEOMETRY/GEOGRAPHY, funzioni ST_* e H3. Estende la Lakehouse con elaborazione raster avanzata, generazione di tile vettoriali e raster, strumenti di geometria migliorati e griglie globali discrete aggiuntive come Quadbin e British National Grid. Il suo livello leggero viene eseguito senza problemi sulle pipeline Databricks Serverless e Lakeflow pipelines, e una suite di lettori e scrittori specializzati aggiunge una gestione specifica del formato per i tipi di file geospaziali comuni.

Sorgenti GitHub →

Documentazione →

Blog →

Altri progetti

Kasal

Kasal è un modo interattivo e low-code per creare e implementare agenti AI sulla piattaforma Databricks.

Sorgenti Github →
Documentazione →

Lakebridge

Lakebridge è la piattaforma di migrazione di Databricks, progettata per fornire alle aziende una soluzione completa ed end-to-end per la modernizzazione di data warehouse legacy e sistemi ETL. Lakebridge supporta un'ampia gamma di piattaforme di origine, tra cui Teradata, Oracle, Snowflake, SQL Server, DataStage e altre ancora, e automatizza ogni fase del processo di migrazione, dalla scoperta e valutazione alla conversione del codice, allo spostamento dei dati e alla convalida, garantendo una transizione rapida e a basso rischio per le organizzazioni che desiderano sbloccare l'innovazione e l'efficienza nel loro patrimonio di dati.

Sorgenti GitHub →
Documentazione →
Blog →

Impulse

Impulse è una libreria di analitiche basata su Python progettata per l'elaborazione di dati di misurazione di serie temporali su larga scala. Basato su Apache Spark e Delta Lake, consente l'elaborazione distribuita di dati dei sensori su scala petabyte provenienti da test automobilistici, IoT industriale e altri domini ad alta intensità di misurazione.

Sorgenti su GitHub →
Documentazione →

OntoBricks

OntoBricks è un'applicazione web che trasforma le tabelle Databricks in un visualizzatore di grafi materializzati. Consente di progettare ontologie (OWL), mapparle su tabelle di Unity Catalog tramite R2RML, materializzare triple in un triple store basato su Delta e in un motore di grafo Lakebase Postgres, ragionare sul grafo (OWL 2 RL, SWRL, SHACL) e interrogarlo tramite un'API GraphQL generata automaticamente. L'intera pipeline, dall'importazione dei metadati a un visualizzatore di Graph interrogabile, può essere eseguita in quattro clic utilizzando l'automazione basata su LLM.

Sorgenti Github →
Documentazione →

coda

Esegui Claude Code, Codex, Gemini CLI, Hermes Agent e OpenCode nel tuo browser: nessuna configurazione, con collegamento diretto al tuo workspace Databricks.

Sorgenti Github →
Documentazione →

VibeScaler

Collabora con il tuo team per definire cosa si intende per un buon comportamento dell'agente, quindi trasforma tale giudizio in un valutatore automatizzato eseguibile su larga scala.

Sorgenti GitHub →
Documentazione →

Lakemeter

Stima i costi del carico di lavoro Databricks in pochi minuti, con presupposti trasparenti che puoi rivedere, condividere ed esportare.

Sorgenti Github →
Documentazione →

Ontos

Ontos fornisce ai team aziendali gli strumenti per organizzare, governare e distribuire data product di alta qualità, seguendo i principi del Data Mesh e standard di settore come ODCS (Open Data Contract Standard) e ODPS (Open Data Product Specification).

Sorgenti GitHub →
Documentazione →
Marketplace →

Databricks MCP

Una raccolta di server MCP per aiutare gli agenti IA a recuperare dati aziendali da Databricks e ad automatizzare le azioni comuni degli sviluppatori su Databricks.

Sorgenti GitHub →

App agente conversazionale

Applicazione dotata di un'interfaccia di chat basata sulle API di conversazione Genie di Databricks, creata appositamente per essere eseguita come Databricks App.

Sorgenti GitHub →

Applicazione chatbot assistente alla conoscenza

Esempio di applicazione chatbot Assistente di conoscenza Databricks.

Sorgenti GitHub →

Applicazione Feature Registry

L'app fornisce un'interfaccia intuitiva per esplorare le feature esistenti in Unity Catalog. Inoltre, gli utenti possono generare codice per creare specifiche delle feature e set di addestramento per addestrare modelli di machine learning e implementare le feature come Endpoint di Feature Serving.

Sorgenti GitHub →

Smolder

Smolder fornisce una sorgente di dati Apache Spark™ SQL per caricare dati EHR da formati di messaggi HL7v2. Inoltre, Smolder offre funzioni di aiuto che possono essere utilizzate su un DataFrame SQL Spark per analizzare testi di messaggi HL7 e per estrarre segmenti, campi e sottocampi da un messaggio.

Sorgenti Github →
Scopri di più →

Data Generator

Genera velocemente dati rilevanti per i tuoi progetti. Il generatore di dati di Databricks può essere usato per generare grandi set di dati simulati/sintetici per test, POC e altri usi

Sorgenti Github →
Scopri di più →

DeltaOMS

Raccolta centralizzata di registri di transazioni Delta per analisi di metadati e metriche operative sul lakehouse.

Sorgenti Github →
Scopri di più →

Splunk Integration

Add-on per Splunk, un'app che consente agli utenti di Splunk Enterprise e Splunk Cloud di eseguire query e azioni, ad esempio eseguire notebook e lavori, in Databricks.

Sorgenti GitHub →
Scopri di più →

DiscoverX

DiscoverX automatizza le attività di amministrazione che richiedono l'ispezione o l'applicazione di attività operative a un gran numero di asset del Lakehouse.

Sorgenti GitHub →

brickster

{brickster} è il toolkit R per Databricks, che include:

  • Wrapper per le API di Databricks (ad es. db_cluster_list, db_volume_read)
  • Sfoglia gli Workspace asset tramite il RStudio Connections Pane (open_workspace())
  • Espone il databricks-sql-connector tramite {reticulate} (docs)
  • REPL interattivo di Databricks

Sorgenti GitHub →
Documentazione →
Blog →

Tempo

Lo scopo di questo progetto è fornire un'API per manipolare serie temporali su Apache Spark. Le funzionalità comprendono featurizzazione con valori temporali ritardati, statistiche continue (media, media aritmetica, somma, conteggio ecc.), giunzioni AS OF e sottocampionamento e interpolazione. Questo sistema è stato testato su svariati TB di dati storici.

Sorgenti GitHub →
Documentazione →
Webinar →

Plugin PyLint

Questo plugin estende PyLint con controlli per errori e problemi comuni nel codice Python, specificamente nell'ambiente Databricks.

Sorgenti Github →
Documentazione →

PyTester

PyTester è un modo potente per gestire la configurazione e la scomposizione dei test in Python. Questa libreria fornisce un set di fixture per aiutarti a scrivere test di integrazione per Databricks.

Sorgenti Github →
Documentazione →

Connettore Java Delta Sharing

Il connettore Java segue il protocollo Delta Sharing per leggere le tabelle condivise da un Delta Sharing Server. Per ridurre e limitare ulteriormente i costi di egress lato Data Provider, abbiamo implementato una cache persistente per eliminare le letture non necessarie.

Sorgenti GitHub →
Documentazione →

UCX

UCX è un toolkit per abilitare Unity Catalog (UC) nel tuo workspace Databricks. UCX fornisce comandi e flussi di lavoro per migrare tabelle e viste in UC. UCX consente di riscrivere dashboard, Job e notebook per utilizzare gli asset di dati migrati in UC. E ci sono molte altre funzionalità.

Sorgenti su GitHub →
Documentazione →
Blog →

migrate-ip-acls

Ricrea l'elenco di accesso IP esistente di un Databricks Workspace come policy di ingresso basata sul contesto (CBI) tramite una singola CLI dedicata.

Sorgenti GitHub →

Firefly

Un'applicazione Next.js che fornisce un frontend personalizzato per Databricks con più strategie di autenticazione e app Databricks incorporate.

Sorgenti Github →
Documentazione →

Tutti i progetti nell'account http://github.com/databrickslabs sono forniti solo a scopo esplorativo e non sono supportati formalmente da Databricks con Service Level Agreement (SLA). Vengono forniti come tali (AS-IS) e senza alcun tipo di garanzia.  Qualsiasi problema derivante dall'uso di questo progetto deve essere registrato come GitHub Issue su Repo. Verranno analizzati quando il tempo lo consentirà, ma non esistono contratti di servizio formali per l'assistenza.