Databricks Labs
Les Databricks Labs sont des projets créés par le terrain pour aider les clients à placer leurs cas d'usage en production plus rapidement !
DQX
Vérification simplifiée de la qualité des données à l'échelle pour les charges de travail PySpark sur les DataFrames en streaming et standard.
sdp-meta
Un framework piloté par les métadonnées pour les pipelines déclaratifs Lakeflow Spark. Définissez les pipelines Bronze et Silver dans un fichier d'intégration JSON ou YAML — un pipeline générique unique lit la spécification résultante au moment de l'exécution et construit le Graphe de traitement complet, ce qui permet à un seul data engineer de gérer des milliers de tables sans écrire de nouveau code de pipeline. Disponible via les Bundles, la CLI, une application Web et un serveur MCP pour une configuration assistée par l'IA.
GeoBrix
GeoBrix fournit un traitement spatial hautes performances qui complète les capacités spatiales natives de Databricks : les types GEOMETRY/GEOGRAPHY, les fonctions ST_* et H3. Il étend le Lakehouse avec un traitement raster avancé, la génération de tuiles vectorielles et raster, des outils de géométrie améliorés et des grilles mondiales discrètes supplémentaires telles que Quadbin et le British National Grid. Sa version légère fonctionne de manière fluide sur les pipelines Databricks Serverless et LakeFlow Pipelines, et une suite de lecteurs et d'outils d'écriture spécialisés ajoute une gestion spécifique au format pour les types de fichiers géospatiaux courants.
Autres projets
Kasal
Kasal est un moyen interactif et low-code de créer et de déployer des agents d'IA sur la plateforme Databricks.
Lakebridge
Lakebridge est la plateforme de migration de Databricks, conçue pour fournir aux entreprises une solution complète de bout en bout pour la modernisation des data warehouse et des systèmes ETL existants. Lakebridge prend en charge un large éventail de plateformes sources — notamment Teradata, Oracle, Snowflake, SQL Server, DataStage, et plus encore — et automatise chaque étape du processus de migration, de la découverte et l'évaluation à la conversion de code, au déplacement des données et à la validation, garantissant une transition rapide et à faible risque pour les organisations cherchant à stimuler l'innovation et l'efficacité au sein de leur patrimoine de données.
Impulse
Impulse est une bibliothèque analytique basée sur Python, conçue pour le traitement de données de mesure de séries temporelles à grande échelle. Basée sur Apache Spark et Delta Lake, elle permet le traitement distribué de données de capteurs à l'échelle du pétaoctet issues des tests automobiles, de l'IoT industriel et d'autres domaines à forte intensité de mesures.
OntoBricks
OntoBricks est une application web qui transforme les tables Databricks en une visionneuse de graphe matérialisé. Elle permet de concevoir des ontologies (OWL), de les mapper sur des tables Unity Catalog via R2RML, de matérialiser des triplets dans un triple store basé sur Delta et un moteur de graphe Lakebase Postgres, d'effectuer des raisonnements sur le graphe (OWL 2 RL, SWRL, SHACL) et de l'interroger via une API GraphQL auto-générée. L'ensemble du pipeline — de l'importation des métadonnées à une visionneuse de graphe interrogeable — peut s'exécuter en quatre clics grâce à une automatisation optimisée par LLM.
coda
Exécutez Claude Code, Codex, Gemini CLI, Hermes Agent et OpenCode dans votre navigateur — sans aucune configuration, connecté à votre Databricks Workspace.
VibeScaler
Collaborez avec votre équipe pour définir ce qui constitue un bon comportement de l'agent, puis transformez ce jugement en un évaluateur automatisé qui s'exécute à grande échelle.
Lakemeter
Estimez les coûts de la charge de travail Databricks en quelques minutes — avec des hypothèses transparentes que vous pouvez examiner, partager et exporter.
Databricks MCP
Une collection de serveurs MCP pour aider les agents d'IA à récupérer les données d'entreprise depuis Databricks et à automatiser les actions courantes des développeurs sur Databricks.
Application d'agent conversationnel
Application dotée d'une interface de chat alimentée par les API Databricks Genie Conversation, conçue spécifiquement pour fonctionner en tant que Databricks App.
Application de chatbot Assistant de connaissances
Exemple d'application de chatbot Assistant de connaissances Databricks.
Application de registre de fonctionnalités
L'application fournit une interface conviviale pour explorer les fonctionnalités existantes dans Unity Catalog. De plus, les utilisateurs peuvent générer du code pour créer des spécifications de features et des jeux de données d'entraînement afin d'entraîner des modèles de machine learning et de déployer des features en tant que points de terminaison de service de features (Feature Serving Endpoints).
Smolder
Smolder fournit une source de données Apache Spark™ SQL pour le chargement des données EHR (Electronic Health Records) à partir des formats de message HL7v2. En outre, Smolder fournit des fonctions d'aide qui peuvent être utilisées sur un DataFrame SQL Spark pour analyser le texte du message HL7 et pour extraire des segments, des champs et des sous-zones d'un message.
Générateur de données
Générez rapidement des données pertinentes pour vos projets. Le générateur de données Databricks peut être utilisé pour générer de grands ensembles de données simulées / synthétiques pour des tests ou encore pour des POC
DeltaOMS
Collecte centralisée des journaux de transactions Delta pour l'analyse des métadonnées et des mesures opérationnelles de votre Lakehouse.
Intégration de Splunk
Extension pour Splunk, une application qui permet aux utilisateurs de Splunk Enterprise et de Splunk Cloud de lancer des requêtes et d'exécuter des actions dans Databricks, telles que l'exécution de notebooks et de tâches.
DiscoverX
DiscoverX automatise les tâches d'administration qui nécessitent d'inspecter ou d'appliquer des opérations à un grand nombre d'actifs Lakehouse.
brickster
{brickster} est le toolkit R pour Databricks, il inclut :
- Wrappers pour les API Databricks (p. ex. db_cluster_list, db_volume_read)
- Browser Workspace assets via RStudio Connections Pane (open_workspace())
- Expose le databricks-sql-connector via {reticulate} (doc)
- REPL interactif Databricks
Tempo
L'objectif de ce projet est de fournir une API pour manipuler des séries chronologiques en plus d'Apache Spark. La fonctionnalité inclut l'utilisation de valeurs temporelles retardées, de statistiques glissantes (moyenne, somme, nombre, etc.), de jointures « depuis » (AS OF joints), de réduction de la fréquence d'échantillonnage et d'interpolation. Elle a été testé sur des TO de données historiques.
Plugin PyLint
Ce plugin étend PyLint avec des vérifications pour les erreurs et problèmes courants dans le code Python, spécifiquement dans l'environnement Databricks.
PyTester
PyTester est un moyen puissant de gérer la configuration et le nettoyage des tests en Python. Cette bibliothèque fournit un ensemble de fixtures pour vous aider à écrire des tests d'intégration pour Databricks.
Connecteur Java Delta Sharing
Le connecteur Java suit le protocole Delta Sharing pour lire les tables partagées à partir d'un serveur Delta Sharing. Pour réduire et limiter davantage les coûts de sortie côté fournisseur de données, nous avons mis en place un cache persistant afin de réduire ces mêmes coûts en supprimant toute lecture inutile.
UCX
UCX est une boîte à outils permettant d'activer Unity Catalog (UC) dans votre Databricks Workspace. UCX fournit des commandes et des workflows pour migrer des tables et des vues vers UC. UCX permet de réécrire les tableaux de bord, les Jobs et les Notebooks pour utiliser les data assets migrés dans UC. Et il existe de nombreuses autres fonctionnalités.
migrate-ip-acls
Recréer la liste d'accès IP existante d'un Databricks Workspace en tant que politique d'entrée basée sur le contexte (CBI) via une seule CLI dédiée.
Firefly
Une application Next.js qui fournit un frontend personnalisé pour Databricks avec plusieurs stratégies d'authentification et des applications Databricks intégrées.
Veuillez noter que tous les projets du compte https://github.com/databrickslabs ne sont fournis qu'à titre d'exemples, et ne sont pas officiellement pris en charge par Databricks dans le cadre d'accords de niveau de service (SLA). Ils sont fournis en l'état et nous ne donnons aucune garantie d'aucune sorte. Tout problème détecté lors de l'utilisation de ce projet doit être signalé en tant que problème GitHub dans le répertoire. Il sera alors examiné lorsque le planning le permettra, mais il n'existe aucun SLA formel pour l'assistance.


