Direkt zum Hauptinhalt

Databricks Labs

Databricks Labs sind Projekte, die aus der Praxis stammen und Kunden bei der Umsetzung von Anwendungsfällen in der Produktion unterstützen sollen

Node

dqx

DQX

Vereinfachte Datenqualitätsprüfung at Scale für PySpark-Workloads auf Streaming- und Standard-DataFrames.

GitHub-Quellen →

Dokumentation →

Kasal

SDP-Meta

Ein metadatengesteuertes Framework für Lakeflow Spark Declarative Pipelines. Definieren Sie Bronze- und Silver-Pipelines in einer JSON- oder YAML-Onboarding-Datei – eine einzige generische Pipeline liest die resultierende Spezifikation zur Laufzeit und erstellt den vollständigen Verarbeitungs-Graph, sodass ein einzelner Data Engineer Tausende von Tabellen verwalten kann, ohne neuen Pipeline-Code schreiben zu müssen. Verfügbar über Bundles, CLI, eine browserbasierte App und einen MCP-Server für eine KI-gestützte Einrichtung.

GitHub-Quellen →

Dokumentation →

Interview mit dem Autor →

Lakebridge

GeoBrix

GeoBrix liefert leistungsstarke räumliche Verarbeitung, die die nativen räumlichen Fähigkeiten von Databricks ergänzt – GEOMETRIE/GEOGRAPHIE-Typen, ST_*-Funktionen und H3. Es erweitert das Lakehouse um erweiterte Rasterverarbeitung, die Erstellung von Vektor- und Rasterkacheln, verbesserte Geometriewerkzeuge und zusätzliche diskrete globale Gitter wie Quadbin und das British National Grid. Seine leichte Stufe läuft reibungslos auf Databricks Serverless- und Lakeflow-Pipelines, und eine Suite spezialisierter Reader und Writer fügt formatspezifische Handhabung gängiger geospatialer Dateitypen hinzu.

GitHub-Quellen →

Dokumentation →

Blog →

Weitere Projekte

Kasal

Kasal ist eine interaktive Low-Code-Möglichkeit, um KI-Agenten auf der Databricks-Plattform zu erstellen und bereitzustellen.

GitHub-Quellen →
Dokumentation →

Lakebridge

Lakebridge ist die Migrationsplattform von Databricks, die Unternehmen eine umfassende End-to-End-Lösung für die Modernisierung von Legacy-Data-Warehouses und ETL-Systemen bietet. Lakebridge unterstützt eine breite Palette von Quellplattformen – einschließlich Teradata, Oracle, Snowflake, SQL Server, DataStage und mehr – und automatisiert jede Phase des Migrationsprozesses, von der Erkennung und Bewertung bis hin zur Code-Konvertierung, Datenverschiebung und Validierung. Dies gewährleistet einen schnellen, risikoarmen Übergang für Organisationen, die Innovation und Effizienz in ihrer Datenlandschaft erschließen möchten.

GitHub Sources →
Dokumentation →
Blog →

Impulse

Impulse ist eine Python-basierte Analysebibliothek, die für die Verarbeitung umfangreicher Zeitreihen-Messdaten entwickelt wurde. Die auf Apache Spark und Delta Lake basierende Bibliothek ermöglicht die verteilte Verarbeitung von Sensordaten im Petabyte-Bereich aus Automobiltests, dem industriellen IoT und anderen messintensiven Bereichen.

Github-Quellen →
Dokumentation →

OntoBricks

OntoBricks ist eine Webanwendung, die Databricks-Tabellen in einen materialisierten Graph-Viewer umwandelt. Sie können damit Ontologien (OWL) entwerfen, sie über R2RML auf Unity Catalog-Tabellen abbilden, Tripel in einem Delta-gestützten Triple Store und einer Lakebase Postgres Graph-Engine materialisieren, über den Graphen schlussfolgern (OWL 2 RL, SWRL, SHACL) und ihn über eine automatisch generierte GraphQL-API abfragen. Die gesamte Pipeline – vom Metadatenimport bis zu einem abfragbaren Graph-Viewer – kann mithilfe von LLM-gestützter Automatisierung mit vier Klicks ausgeführt werden.

Github-Quellen →
Dokumentation →

Koda

Führen Sie Claude Code, Codex, Gemini CLI, Hermes Agent und OpenCode in Ihrem Browser aus – ohne Einrichtung, verbunden mit Ihrem Databricks-Workspace.

Github-Quellen →
Dokumentation →

VibeScaler

Arbeiten Sie mit Ihrem Team zusammen, um zu definieren, wie gutes Agentenverhalten aussieht, und wandeln Sie diese Beurteilung dann in einen automatisierten Grader um, der skaliert ausgeführt wird.

GitHub-Quellen →
Dokumentation →

Lakemeter

Schätzen Sie die Kosten für Databricks-Workloads in wenigen Minuten – mit transparenten Annahmen, die Sie überprüfen, teilen und exportieren können.

Github-Quellen →
Dokumentation →

Ontos

Ontos bietet Teams in Unternehmen die Werkzeuge, um hochwertige Datenprodukte gemäß den Data-Mesh-Prinzipien und Branchenstandards wie ODCS (Open Data Contract Standard) und ODPS (Open Data Product Specification) zu organisieren, zu steuern und bereitzustellen.

GitHub-Quellen →
Dokumentation →
Marketplace →

Databricks MCP

Eine Sammlung von MCP-Servern, die KI-Agenten dabei helfen, Unternehmensdaten aus Databricks abzurufen und gängige Entwickleraktionen auf Databricks zu automatisieren.

GitHub-Quellen →

Konversationsagenten-App

Anwendung mit einer Chat-Oberfläche, die von den Databricks Genie Conversation APIs unterstützt wird und speziell für die Ausführung als Databricks-App entwickelt wurde.

GitHub-Quellen →

Wissensassistent-Chatbot-Anwendung

Beispiel für Databricks Knowledge Assistant Chatbot-Anwendung.

GitHub-Quellen →

Feature-Registry-Anwendung

Die App bietet eine benutzerfreundliche Oberfläche zum Erkunden vorhandener Features im Unity Catalog. Zusätzlich können Benutzer Code zum Erstellen von Feature-Spezifikationen und Trainingssätzen generieren, um Machine-Learning-Modelle zu trainieren und Features als Feature Serving Endpoints bereitzustellen.

GitHub-Quellen →

Smolder

Smolder bietet eine Apache Spark™-SQL-Datenquelle zum Laden von EHR-Daten aus HL7v2-Nachrichtenformaten. Darüber hinaus implementiert Smolder Hilfsfunktionen, die auf einem Spark SQL-DataFrame zum Analysieren von HL7-Nachrichtentext und zum Extrahieren von Segmenten, Feldern und Unterfeldern aus einer Nachricht verwendet werden können.

GitHub-Quellen →
Mehr erfahren →

Data Generator

Erstellen Sie im Handumdrehen relevante Daten für Ihre Projekte. Mit dem Databricks-Datengenerator generieren Sie umfangreiche simulierte/synthetische Datenbestände für Tests, PoCs und weitere Einsatzzwecke.

Github-Quellen →
Mehr erfahren →

DeltaOMS

Zentralisierte Sammlung von Delta-Transaktionsprotokollen für die Analyse von Metadaten und Betriebsmetriken in Ihrem Lakehouse

GitHub-Quellen →
Mehr erfahren →

Splunk-Integration

Add-On für Splunk. Mit dieser App können Splunk Enterprise- und Splunk Cloud-Benutzer Abfragen und Aktionen, z. B. Notebooks und Jobs, in Databricks ausführen.

Github-Quellen →
Mehr erfahren →

DiscoverX

DiscoverX automatisiert Verwaltungsaufgaben, die das Inspizieren oder Anwenden von Operationen auf eine große Anzahl von Lakehouse-Assets erfordern.

GitHub-Quellen →

brickster

{brickster} ist das R-Toolkit für Databricks, es beinhaltet:

  • Wrapper für Databricks-APIs (z. B. db_cluster_list, db_volume_read)
  • Browser-Workspace-Assets über RStudio Connections Pane (open_workspace())
  • Macht den databricks-sql-connector über {reticulate} (docs) verfügbar
  • Interaktive Databricks-REPL

GitHub-Quellen →
Dokumentation →
Blog →

Tempo

Zweck dieses Projekts ist es, eine API für die Bearbeitung von Zeitreihen bereitzustellen, das auf Apache Spark aufsetzt. Zu den Funktionen gehören Featurisierung mit verzögerten Zeitwerten, rollierende Statistiken (Mittelwert, Durchschnitt, Summe, Anzahl usw.), AS OF-Joins sowie Downsampling und Interpolation. Das Projekt wurde mit historischen Daten in TB-Größenordnung getestet.

GitHub-Quellen →
Dokumentation →
Webinar →

PyLint-Plugin

Dieses Plug-in erweitert PyLint um Prüfungen auf häufige Fehler und Probleme in Python-Code, speziell in der Databricks-Umgebung.

Github-Quellen →
Dokumentation →

PyTester

PyTester ist eine leistungsstarke Methode zur Verwaltung des Test-Setups und -Teardowns in Python. Diese Bibliothek bietet eine Reihe von Fixtures, die Ihnen beim Schreiben von Integrationstests für Databricks helfen.

Github-Quellen →
Dokumentation →

Delta Sharing Java-Connector

Der Java-Connector folgt dem Delta Sharing Protokoll, um freigegebene Tabellen von einem Delta Sharing Server zu lesen. Um die Egress-Kosten aufseiten des Datenanbieters weiter zu reduzieren, haben wir einen persistenten Cache implementiert, der unnötige Lesevorgänge eliminiert.

GitHub-Quellen →
Dokumentation →

UCX

UCX ist ein Toolkit zur Aktivierung von Unity Catalog (UC) in Ihrem Databricks-Workspace. UCX bietet Befehle und Workflows für die Migration von Tabellen und Ansichten zu UC. UCX ermöglicht das Umschreiben von Dashboards, Jobs und Notebooks, um die migrierten Daten-Assets in UC zu verwenden. Und es gibt noch viele weitere Features.

GitHub-Quellen →
Dokumentation →
Blog →

migrate-ip-acls

Erstellen Sie die bestehende IP-Zugriffsliste eines Databricks Workspace als kontextbasierte Ingress-(CBI)-Richtlinie über eine einzige, fokussierte CLI nach.

GitHub-Quellen →

Firefly

Eine Next.js-Anwendung, die ein angepasstes Frontend für Databricks mit mehreren Authentifizierungsstrategien und eingebetteten Databricks-Apps bereitstellt.

GitHub-Quellen →
Dokumentation →

Bitte beachten Sie, dass alle Projekte auf der Website http://github.com/databrickslabs nur zum Kennenlernen vorgestellt und von Databricks nicht formell mit Service Level Agreements (SLAs) unterstützt werden. Sie werden wie besehen („as is“) angeboten und wir übernehmen keine Garantien jeglicher Art.  Alle durch die Verwendung dieses Projekts erkundeten Vorgänge sollten als GitHub-Probleme im Repository eingereicht werden. Sie werden überprüft, sobald es die Zeit erlaubt, aber es gibt keine formellen SLAs für den Support.