Databricks Labs
I Databricks Labs sono progetti creati sul campo per aiutare i clienti a portare i loro casi d'uso in produzione più velocemente!
DQX
Controllo semplificato della qualità dei dati su larga scala per carichi di lavoro PySpark su DataFrames standard e di streaming.
sdp-meta
Un framework guidato da metadati per Lakeflow Spark Declarative Pipelines. Definisci le pipeline Bronze e Silver in un file di onboarding JSON o YAML: una singola pipeline generica legge la specifica risultante in fase di esecuzione e costruisce il Graph di elaborazione completo, in modo che un singolo data engineer possa gestire migliaia di tabelle senza scrivere nuovo codice per le pipeline. Disponibile tramite bundle, CLI, un'app basata su browser e un server MCP per la configurazione assistita da AI.
GeoBrix
GeoBrix offre un'elaborazione spaziale ad alte prestazioni che integra le capacità spaziali native di Databricks: tipi GEOMETRY/GEOGRAPHY, funzioni ST_* e H3. Estende la Lakehouse con elaborazione raster avanzata, generazione di tile vettoriali e raster, strumenti di geometria migliorati e griglie globali discrete aggiuntive come Quadbin e British National Grid. Il suo livello leggero viene eseguito senza problemi sulle pipeline Databricks Serverless e Lakeflow pipelines, e una suite di lettori e scrittori specializzati aggiunge una gestione specifica del formato per i tipi di file geospaziali comuni.
Altri progetti
Kasal
Kasal è un modo interattivo e low-code per creare e implementare agenti AI sulla piattaforma Databricks.
Lakebridge
Lakebridge è la piattaforma di migrazione di Databricks, progettata per fornire alle aziende una soluzione completa ed end-to-end per la modernizzazione di data warehouse legacy e sistemi ETL. Lakebridge supporta un'ampia gamma di piattaforme di origine, tra cui Teradata, Oracle, Snowflake, SQL Server, DataStage e altre ancora, e automatizza ogni fase del processo di migrazione, dalla scoperta e valutazione alla conversione del codice, allo spostamento dei dati e alla convalida, garantendo una transizione rapida e a basso rischio per le organizzazioni che desiderano sbloccare l'innovazione e l'efficienza nel loro patrimonio di dati.
Impulse
Impulse è una libreria di analitiche basata su Python progettata per l'elaborazione di dati di misurazione di serie temporali su larga scala. Basato su Apache Spark e Delta Lake, consente l'elaborazione distribuita di dati dei sensori su scala petabyte provenienti da test automobilistici, IoT industriale e altri domini ad alta intensità di misurazione.
OntoBricks
OntoBricks è un'applicazione web che trasforma le tabelle Databricks in un visualizzatore di grafi materializzati. Consente di progettare ontologie (OWL), mapparle su tabelle di Unity Catalog tramite R2RML, materializzare triple in un triple store basato su Delta e in un motore di grafo Lakebase Postgres, ragionare sul grafo (OWL 2 RL, SWRL, SHACL) e interrogarlo tramite un'API GraphQL generata automaticamente. L'intera pipeline, dall'importazione dei metadati a un visualizzatore di Graph interrogabile, può essere eseguita in quattro clic utilizzando l'automazione basata su LLM.
coda
Esegui Claude Code, Codex, Gemini CLI, Hermes Agent e OpenCode nel tuo browser: nessuna configurazione, con collegamento diretto al tuo workspace Databricks.
VibeScaler
Collabora con il tuo team per definire cosa si intende per un buon comportamento dell'agente, quindi trasforma tale giudizio in un valutatore automatizzato eseguibile su larga scala.
Lakemeter
Stima i costi del carico di lavoro Databricks in pochi minuti, con presupposti trasparenti che puoi rivedere, condividere ed esportare.
Databricks MCP
Una raccolta di server MCP per aiutare gli agenti IA a recuperare dati aziendali da Databricks e ad automatizzare le azioni comuni degli sviluppatori su Databricks.
App agente conversazionale
Applicazione dotata di un'interfaccia di chat basata sulle API di conversazione Genie di Databricks, creata appositamente per essere eseguita come Databricks App.
Applicazione chatbot assistente alla conoscenza
Esempio di applicazione chatbot Assistente di conoscenza Databricks.
Applicazione Feature Registry
L'app fornisce un'interfaccia intuitiva per esplorare le feature esistenti in Unity Catalog. Inoltre, gli utenti possono generare codice per creare specifiche delle feature e set di addestramento per addestrare modelli di machine learning e implementare le feature come Endpoint di Feature Serving.
Smolder
Smolder fornisce una sorgente di dati Apache Spark™ SQL per caricare dati EHR da formati di messaggi HL7v2. Inoltre, Smolder offre funzioni di aiuto che possono essere utilizzate su un DataFrame SQL Spark per analizzare testi di messaggi HL7 e per estrarre segmenti, campi e sottocampi da un messaggio.
Data Generator
Genera velocemente dati rilevanti per i tuoi progetti. Il generatore di dati di Databricks può essere usato per generare grandi set di dati simulati/sintetici per test, POC e altri usi
DeltaOMS
Raccolta centralizzata di registri di transazioni Delta per analisi di metadati e metriche operative sul lakehouse.
Splunk Integration
Add-on per Splunk, un'app che consente agli utenti di Splunk Enterprise e Splunk Cloud di eseguire query e azioni, ad esempio eseguire notebook e lavori, in Databricks.
DiscoverX
DiscoverX automatizza le attività di amministrazione che richiedono l'ispezione o l'applicazione di attività operative a un gran numero di asset del Lakehouse.
brickster
{brickster} è il toolkit R per Databricks, che include:
- Wrapper per le API di Databricks (ad es. db_cluster_list, db_volume_read)
- Sfoglia gli Workspace asset tramite il RStudio Connections Pane (open_workspace())
- Espone il databricks-sql-connector tramite {reticulate} (docs)
- REPL interattivo di Databricks
Tempo
Lo scopo di questo progetto è fornire un'API per manipolare serie temporali su Apache Spark. Le funzionalità comprendono featurizzazione con valori temporali ritardati, statistiche continue (media, media aritmetica, somma, conteggio ecc.), giunzioni AS OF e sottocampionamento e interpolazione. Questo sistema è stato testato su svariati TB di dati storici.
Plugin PyLint
Questo plugin estende PyLint con controlli per errori e problemi comuni nel codice Python, specificamente nell'ambiente Databricks.
PyTester
PyTester è un modo potente per gestire la configurazione e la scomposizione dei test in Python. Questa libreria fornisce un set di fixture per aiutarti a scrivere test di integrazione per Databricks.
Connettore Java Delta Sharing
Il connettore Java segue il protocollo Delta Sharing per leggere le tabelle condivise da un Delta Sharing Server. Per ridurre e limitare ulteriormente i costi di egress lato Data Provider, abbiamo implementato una cache persistente per eliminare le letture non necessarie.
UCX
UCX è un toolkit per abilitare Unity Catalog (UC) nel tuo workspace Databricks. UCX fornisce comandi e flussi di lavoro per migrare tabelle e viste in UC. UCX consente di riscrivere dashboard, Job e notebook per utilizzare gli asset di dati migrati in UC. E ci sono molte altre funzionalità.
migrate-ip-acls
Ricrea l'elenco di accesso IP esistente di un Databricks Workspace come policy di ingresso basata sul contesto (CBI) tramite una singola CLI dedicata.
Firefly
Un'applicazione Next.js che fornisce un frontend personalizzato per Databricks con più strategie di autenticazione e app Databricks incorporate.
Tutti i progetti nell'account http://github.com/databrickslabs sono forniti solo a scopo esplorativo e non sono supportati formalmente da Databricks con Service Level Agreement (SLA). Vengono forniti come tali (AS-IS) e senza alcun tipo di garanzia. Qualsiasi problema derivante dall'uso di questo progetto deve essere registrato come GitHub Issue su Repo. Verranno analizzati quando il tempo lo consentirà, ma non esistono contratti di servizio formali per l'assistenza.


