Revenir au contenu principal
databricks-logo-dark

TÉMOIGNAGE
CLIENT

Du chaos des données à un score de confiance pour chaque table

Regarder la vidéo

Plus de 100 000 tables

Désormais classées et gouvernées automatiquement, éliminant ainsi les cycles d'audit manuels

À l'échelle de l'exaoctet

Le Data Governance Score attribue à chaque jeu de données une note de confiance mesurable, liée à sa préparation pour l'AI

Plus de 10 000

Employés de Databricks — tous utilisant la plateforme quotidiennement, de l'ingénierie à la finance

Le lakehouse interne de Databricks contient plus de 100 000 tables couvrant l'ingénierie, le go-to-market, les HR, la finance et la télémétrie des produits. Avant Unity Catalog, la gouvernance était incohérente : les modèles d'accès variaient selon les équipes, les classifications étaient incomplètes et personne ne pouvait affirmer avec certitude quels jeux de données étaient sûrs pour l'entraînement de l'AI. L'équipe de la plateforme de données a reconstruit la gouvernance à partir des principes fondamentaux. Ils rendent la gouvernance chez Databricks automatique, mesurable et prête pour l'ère de l'AI agentique. Voici comment ils ont procédé.

Quand personne ne peut répondre à la question : « ces données sont-elles gouvernées ? »

Databricks se développait rapidement, et ses données encore plus vite. Plus de 100 000 tables étaient réparties entre des dizaines d'équipes, d'espaces de travail et de catalogues. Chaque équipe gérait les accès différemment. Les classifications étaient incohérentes ou totalement absentes.

Les frictions n'étaient pas théoriques. Les équipes de sécurité, juridiques et d'ingénierie passaient des heures à chercher dans des feuilles de calcul pour répondre à des questions simples lors des revues de conformité. Les nouveaux projets d'AI stagnaient parce que personne ne pouvait confirmer si un jeu de données respectait les exigences de confidentialité. Lorsqu'une équipe souhaitait entraîner un modèle, il n'existait aucun moyen systématique de vérifier si les données d'entraînement étaient classées, gouvernées ou même à jour.

« Tout le monde avait un accès en lecture et en écriture à chaque table, à chaque tâche », explique Bruce Wong, directeur principal de l'ingénierie et responsable de la plateforme de données chez Databricks. « Non seulement il n'y avait pas de source unique de vérité, mais il y avait de nombreuses sources, et aucune vérité. » Bruce Wong qualifie ce dont l'équipe a hérité de « marécage de données » (data swamp), cloisonné, non gouverné et impossible à mettre à l'échelle.

Le défi ne venait pas d'un manque de bonnes intentions. Les équipes se souciaient de la qualité des données. Mais le modèle de gouvernance qui fonctionnait pour 10 personnes et un gigaoctet ne fonctionne plus pour 10 000 personnes et un exaoctet. Sans système unifié, la gouvernance n'était qu'un assemblage de processus manuels qui ne parvenaient pas à suivre le rythme.

Pendant ce temps, l'équipe de la plateforme de données a modernisé l'ensemble du patrimoine de données, de l'ingestion de données SaaS via Lakeflow Connect à la portabilité multi-cloud, en passant par l'analyse fédérée entre les différents domaines d'activité. Pour suivre la croissance de l'entreprise, chaque secteur d'activité avait besoin de données fiables et gouvernées pour fonctionner. L'équipe de la plateforme avait besoin d'une solution qui convienne non seulement aux ingénieurs qui construisent les pipelines, mais aussi à chaque analyste, marketeur, responsable financier et commercial de l'entreprise. Li Yang, responsable principal de l'ingénierie chez Databricks, connaissait bien ce défi pour avoir passé une décennie dans d'autres entreprises technologiques confrontées à des problèmes de croissance similaires. « Dans le monde du B2B, la confiance n'est pas une fonctionnalité. La confiance est le produit », déclare Li Yang. « Nous devions abandonner un modèle qui donnait l'impression d'essayer de réparer un avion en plein vol. »

Classification, contrôles d'accès et un score pour chaque jeu de données

L'équipe a commencé en tant que client alpha de Unity Catalog avec un principe directeur : chaque jeu de données doit être fiable, gouverné et prêt pour l'AI par défaut — grâce à des garde-fous, et non des barrières. Unity Catalog leur a permis de prendre des décisions de politique et de gouvernance au niveau du catalogue plutôt que de gérer les utilisateurs et les tables individuellement, un changement de paradigme qui a fondamentalement modifié leur approche du lakehouse.

Tout d'abord, ils ont construit un modèle de classification universel au sein de Unity Catalog. Chaque table est étiquetée selon la sensibilité des données (Public, Interne, Confidentiel, Restreint, Hautement restreint) et par domaine (Ingénierie, GTM, HR, Finance, etc.). Ces étiquettes correspondent à des zones de gouvernance qui déterminent l'application des accès. Deuxièmement, ils ont automatisé les contrôles d'accès. Une plateforme interne appelée Fortress, construite sur les API de sécurité de Unity Catalog, applique un accès limité dans le temps et lié à un objectif précis. Fini les autorisations permanentes. Chaque demande doit être motivée, expire comme prévu et est entièrement auditable.

Pour mesurer la confiance à grande échelle, l'équipe a créé le Data Governance Score, qui fournit une mesure continue de 0 à 100 pour chaque jeu de données. Ce score évalue trois piliers : la documentation (les colonnes sont-elles décrites et les tables annotées ?), la fiabilité (les contrôles de qualité des données réussissent-ils ?) et la gouvernance (les données sont-elles classées et soumises à un contrôle d'accès ?). Le Data Governance Score se propage en aval via le lignage : si une table en amont perd sa fiabilité, toutes les tables qui en dépendent reflètent automatiquement ce changement. Amit Pahwa, ingénieur logiciel principal (Staff Software Engineer) au sein de l'équipe Databricks Data Platform, a contribué à concevoir le Data Governance Score pour éviter que l'entreprise ne dépende de connaissances informelles. Il souligne que sans données structurées, « la confiance fait toute la différence entre se baser sur des faits ou sur son intuition. »

Au-delà de la couche de gouvernance principale, d'autres flux de travail de la plateforme de données étendent sa portée. Lakeflow Connect gère l'ingestion SaaS sécurisée à grande échelle, remplaçant les connecteurs fragiles par des pipelines gouvernés qui acheminent les données directement dans l'architecture médaillon. Une plateforme multi-cloud garantit que les charges de travail sont portables et sécurisées sur AWS, Azure et GCP. Une couche d'analyse fédérée offre à chaque domaine d'activité, de la finance au marketing en passant par les opérations de vente, un accès en libre-service aux données gouvernées grâce à des outils comme AI/BI Genie et Databricks Apps. Un magasin de métriques dédié, construit sur les Metric Views de Unity Catalog, garantit que toutes les équipes de l'entreprise partagent une définition unique pour chaque métrique clé. L'implémentation de Fortress a représenté un changement culturel pour l'entreprise. « Avant Fortress, demander l'accès aux données ressemblait à une boîte noire pour les utilisateurs », explique Li Yang. « Désormais, il s'agit d'un processus transparent en libre-service où la politique est appliquée automatiquement, ce qui permet aux ingénieurs de se concentrer sur l'innovation plutôt que d'approuver manuellement des tickets. »

L'AI agentique exige la gouvernance qu'ils ont déjà mise en place

Le Data Governance Score a apporté à l'équipe de la plateforme de données ce qu'elle n'avait jamais eu : une visibilité en temps réel sur les domaines conformes et ceux qui nécessitaient une attention particulière. Chacune des plus de 100 000 tables est désormais analysée en continu et se voit attribuer une note de confiance de 0 à 100. Au lieu que les revues de conformité ne déclenchent des situations d'urgence, l'équipe repère les points faibles en temps réel et les traite de manière proactive. Les équipes de sécurité et juridiques consacrent leur temps à prévenir les risques plutôt qu'à chercher des feuilles de calcul.

L'impact global va bien au-delà de la conformité. Des données fiables accélèrent chaque flux de travail en aval. Lorsqu'une équipe souhaite entraîner un modèle, elle vérifie le score de gouvernance et sait immédiatement si les données sont à la hauteur — pas de revue manuelle, pas d'attente d'approbations. Le magasin de métriques garantit que lorsque la direction pose une question sur le pipeline, le chiffre d'affaires ou l'utilisation, la réponse est la même, peu importe qui exécute la requête ou quel outil est utilisé.

Mais la transformation la plus importante est celle que l'équipe n'avait pas prévue. Bruce Wong le formule sans détour : « La gouvernance des données est un prérequis indispensable pour l'AI agentique. » Un être humain ne parcourra jamais 100 000 tables. Un agent d'AI trouvera les données obsolètes, la table aux autorisations excessives ou le jeu de données non classé sur lequel un humain ne tomberait jamais. « À ce stade, l'AI est plus susceptible de trouver de mauvaises données et de vous donner une réponse basée sur ces données que d'halluciner réellement », prévient Bruce Wong. L'infrastructure de gouvernance que l'équipe a passé des années à construire, du modèle de classification au Data Governance Score en passant par la propagation de la confiance basée sur le lignage, sert désormais de couche de garde-fous pour les agents dans toute l'entreprise.

Aujourd'hui, chaque service de Databricks (ingénierie, finance, marketing, ventes et même services généraux) utilise des agents basés sur cette fondation gouvernée. La quantité de données générées par l'AI agentique croît à un rythme qui, selon Bruce Wong, dépassera bientôt celui des données générées par l'homme. Comme les structures de gouvernance ont été conçues pour les humains à grande échelle, elles se transposent directement aux agents à grande échelle. L'équipe qui a reconstruit la gouvernance à partir des principes fondamentaux est désormais l'équipe qui prépare l'avenir de l'AI de l'entreprise.

En savoir plus