Revenir au contenu principal

Databricks Labs

Les Databricks Labs sont des projets créés par le terrain pour aider les clients à placer leurs cas d'usage en production plus rapidement !

Node

dqx

DQX

Vérification simplifiée de la qualité des données à l'échelle pour les charges de travail PySpark sur les DataFrames en streaming et standard.

Sources GitHub →

Documentation →

Kasal

sdp-meta

Un framework piloté par les métadonnées pour les pipelines déclaratifs Lakeflow Spark. Définissez les pipelines Bronze et Silver dans un fichier d'intégration JSON ou YAML — un pipeline générique unique lit la spécification résultante au moment de l'exécution et construit le Graphe de traitement complet, ce qui permet à un seul data engineer de gérer des milliers de tables sans écrire de nouveau code de pipeline. Disponible via les Bundles, la CLI, une application Web et un serveur MCP pour une configuration assistée par l'IA.

Sources Github →

Documentation →

Interview avec l'auteur →

Lakebridge

GeoBrix

GeoBrix fournit un traitement spatial hautes performances qui complète les capacités spatiales natives de Databricks : les types GEOMETRY/GEOGRAPHY, les fonctions ST_* et H3. Il étend le Lakehouse avec un traitement raster avancé, la génération de tuiles vectorielles et raster, des outils de géométrie améliorés et des grilles mondiales discrètes supplémentaires telles que Quadbin et le British National Grid. Sa version légère fonctionne de manière fluide sur les pipelines Databricks Serverless et LakeFlow Pipelines, et une suite de lecteurs et d'outils d'écriture spécialisés ajoute une gestion spécifique au format pour les types de fichiers géospatiaux courants.

Sources Github →

Documentation →

Blog →

Autres projets

Kasal

Kasal est un moyen interactif et low-code de créer et de déployer des agents d'IA sur la plateforme Databricks.

Sources Github →
Documentation →

Lakebridge

Lakebridge est la plateforme de migration de Databricks, conçue pour fournir aux entreprises une solution complète de bout en bout pour la modernisation des data warehouse et des systèmes ETL existants. Lakebridge prend en charge un large éventail de plateformes sources — notamment Teradata, Oracle, Snowflake, SQL Server, DataStage, et plus encore — et automatise chaque étape du processus de migration, de la découverte et l'évaluation à la conversion de code, au déplacement des données et à la validation, garantissant une transition rapide et à faible risque pour les organisations cherchant à stimuler l'innovation et l'efficacité au sein de leur patrimoine de données.

Sources GitHub →
Documentation →
Blog →

Impulse

Impulse est une bibliothèque analytique basée sur Python, conçue pour le traitement de données de mesure de séries temporelles à grande échelle. Basée sur Apache Spark et Delta Lake, elle permet le traitement distribué de données de capteurs à l'échelle du pétaoctet issues des tests automobiles, de l'IoT industriel et d'autres domaines à forte intensité de mesures.

Sources Github →
Documentation →

OntoBricks

OntoBricks est une application web qui transforme les tables Databricks en une visionneuse de graphe matérialisé. Elle permet de concevoir des ontologies (OWL), de les mapper sur des tables Unity Catalog via R2RML, de matérialiser des triplets dans un triple store basé sur Delta et un moteur de graphe Lakebase Postgres, d'effectuer des raisonnements sur le graphe (OWL 2 RL, SWRL, SHACL) et de l'interroger via une API GraphQL auto-générée. L'ensemble du pipeline — de l'importation des métadonnées à une visionneuse de graphe interrogeable — peut s'exécuter en quatre clics grâce à une automatisation optimisée par LLM.

Sources Github →
Documentation →

coda

Exécutez Claude Code, Codex, Gemini CLI, Hermes Agent et OpenCode dans votre navigateur — sans aucune configuration, connecté à votre Databricks Workspace.

Sources Github →
Documentation →

VibeScaler

Collaborez avec votre équipe pour définir ce qui constitue un bon comportement de l'agent, puis transformez ce jugement en un évaluateur automatisé qui s'exécute à grande échelle.

Sources GitHub →
Documentation →

Lakemeter

Estimez les coûts de la charge de travail Databricks en quelques minutes — avec des hypothèses transparentes que vous pouvez examiner, partager et exporter.

Sources Github →
Documentation →

Ontos

Ontos fournit aux équipes d'entreprise les outils nécessaires pour organiser, gouverner et fournir des produits de données de haute qualité, en suivant les principes du Data Mesh et les normes du secteur telles que ODCS (Open Data Contract Standard) et ODPS (Open Data Product Specification).

Sources GitHub →
Documentation →
Marketplace →

Databricks MCP

Une collection de serveurs MCP pour aider les agents d'IA à récupérer les données d'entreprise depuis Databricks et à automatiser les actions courantes des développeurs sur Databricks.

Sources Github →

Application d'agent conversationnel

Application dotée d'une interface de chat alimentée par les API Databricks Genie Conversation, conçue spécifiquement pour fonctionner en tant que Databricks App.

Sources Github →

Application de chatbot Assistant de connaissances

Exemple d'application de chatbot Assistant de connaissances Databricks.

Sources Github →

Application de registre de fonctionnalités

L'application fournit une interface conviviale pour explorer les fonctionnalités existantes dans Unity Catalog. De plus, les utilisateurs peuvent générer du code pour créer des spécifications de features et des jeux de données d'entraînement afin d'entraîner des modèles de machine learning et de déployer des features en tant que points de terminaison de service de features (Feature Serving Endpoints).

Sources Github →

Smolder

Smolder fournit une source de données Apache Spark™ SQL pour le chargement des données EHR (Electronic Health Records) à partir des formats de message HL7v2. En outre, Smolder fournit des fonctions d'aide qui peuvent être utilisées sur un DataFrame SQL Spark pour analyser le texte du message HL7 et pour extraire des segments, des champs et des sous-zones d'un message.

Sources Github →
En savoir plus →

Générateur de données

Générez rapidement des données pertinentes pour vos projets. Le générateur de données Databricks peut être utilisé pour générer de grands ensembles de données simulées / synthétiques pour des tests ou encore pour des POC

Sources GitHub →
En savoir plus →

DeltaOMS

Collecte centralisée des journaux de transactions Delta pour l'analyse des métadonnées et des mesures opérationnelles de votre Lakehouse.

Sources Github →
En savoir plus →

Intégration de Splunk

Extension pour Splunk, une application qui permet aux utilisateurs de Splunk Enterprise et de Splunk Cloud de lancer des requêtes et d'exécuter des actions dans Databricks, telles que l'exécution de notebooks et de tâches.

Sources Github →
En savoir plus →

DiscoverX

DiscoverX automatise les tâches d'administration qui nécessitent d'inspecter ou d'appliquer des opérations à un grand nombre d'actifs Lakehouse.

Sources Github →

brickster

{brickster} est le toolkit R pour Databricks, il inclut :

  • Wrappers pour les API Databricks (p. ex. db_cluster_list, db_volume_read)
  • Browser Workspace assets via RStudio Connections Pane (open_workspace())
  • Expose le databricks-sql-connector via {reticulate} (doc)
  • REPL interactif Databricks

Sources GitHub →
Documentation →
Blog →

Tempo

L'objectif de ce projet est de fournir une API pour manipuler des séries chronologiques en plus d'Apache Spark. La fonctionnalité inclut l'utilisation de valeurs temporelles retardées, de statistiques glissantes (moyenne, somme, nombre, etc.), de jointures « depuis » (AS OF joints), de réduction de la fréquence d'échantillonnage et d'interpolation. Elle a été testé sur des TO de données historiques.

Sources GitHub →
Documentation →
Webinaire →

Plugin PyLint

Ce plugin étend PyLint avec des vérifications pour les erreurs et problèmes courants dans le code Python, spécifiquement dans l'environnement Databricks.

Sources Github →
Documentation →

PyTester

PyTester est un moyen puissant de gérer la configuration et le nettoyage des tests en Python. Cette bibliothèque fournit un ensemble de fixtures pour vous aider à écrire des tests d'intégration pour Databricks.

Sources Github →
Documentation →

Connecteur Java Delta Sharing

Le connecteur Java suit le protocole Delta Sharing pour lire les tables partagées à partir d'un serveur Delta Sharing. Pour réduire et limiter davantage les coûts de sortie côté fournisseur de données, nous avons mis en place un cache persistant afin de réduire ces mêmes coûts en supprimant toute lecture inutile.

Sources GitHub →
Documentation →

UCX

UCX est une boîte à outils permettant d'activer Unity Catalog (UC) dans votre Databricks Workspace. UCX fournit des commandes et des workflows pour migrer des tables et des vues vers UC. UCX permet de réécrire les tableaux de bord, les Jobs et les Notebooks pour utiliser les data assets migrés dans UC. Et il existe de nombreuses autres fonctionnalités.

Sources GitHub →
Documentation →
Blog →

migrate-ip-acls

Recréer la liste d'accès IP existante d'un Databricks Workspace en tant que politique d'entrée basée sur le contexte (CBI) via une seule CLI dédiée.

Sources GitHub →

Firefly

Une application Next.js qui fournit un frontend personnalisé pour Databricks avec plusieurs stratégies d'authentification et des applications Databricks intégrées.

Sources Github →
Documentation →

Veuillez noter que tous les projets du compte https://github.com/databrickslabs ne sont fournis qu'à titre d'exemples, et ne sont pas officiellement pris en charge par Databricks dans le cadre d'accords de niveau de service (SLA). Ils sont fournis en l'état et nous ne donnons aucune garantie d'aucune sorte.  Tout problème détecté lors de l'utilisation de ce projet doit être signalé en tant que problème GitHub dans le répertoire. Il sera alors examiné lorsque le planning le permettra, mais il n'existe aucun SLA formel pour l'assistance.