Revenir au contenu principal

Libérer la sémantique pour l'AI : comment Mercedes-Benz Corée a développé une solution « Talk to Data » de confiance à l'échelle

Comment Mercedes-Benz Korea et Databricks ont piloté une sémantique prête pour l'IA et des agents IA à l'aide d'Unity Catalog, des Metric Views, de Genie et d'Agent Bricks

par Sai Yang, Fares Kamal, Alina Kamal, Andreas Jäck, Johannes Laufer et Manuel Culebras

  • Une couche KPI unique : Mercedes-Benz Korea s'est appuyé sur son architecture Lakehouse et sa pile Power BI existantes en rendant plus de 500 définitions de KPI disponibles dans une couche sémantique ouverte et prête pour l'IA sur les vues de métriques Unity Catalog, en utilisant un transpileur automatisé DAX-to-Metric-View de Databricks pour accélérer la transition.
  • Sémantique gouvernée pour la BI et l'IA : Avec les vues de métriques Unity Catalog, Mercedes-Benz Korea a étendu sa couche sémantique gouvernée pour les KPI d'entreprise. Cette couche prend en charge à la fois les rapports BI existants et les nouvelles expériences « Talk to Data », Genie et Agent Bricks fournissant des réponses cohérentes avec les définitions de KPI existantes.
  • Passage à l'échelle de « Talk to Data » sur tous les marchés : En s'appuyant sur les vues de métriques Unity Catalog, Genie et Agent Bricks, Mercedes-Benz Korea élabore un guide pratique pour les agents IA basés sur des personas au-dessus d'une couche KPI partagée, qui peut servir de référence pour d'autres marchés de vente de Mercedes-Benz afin de permettre des analyses en libre-service pour les équipes commerciales, produit, financières et marketing.

« Talk to Data » devient rapidement une capacité essentielle dans tous les secteurs, et sa mise en œuvre à l'échelle de l'entreprise nécessite une base sémantique solide. La fiabilité des réponses est maximale lorsque l'IA peut s'appuyer sur une logique métier clairement gouvernée, plutôt que de la déduire de schémas complexes, de logiques de KPI spécifiques à des rapports ou de tableaux de bord déconnectés. Des définitions de KPI cohérentes, une logique métier alignée ainsi que des jointures et des agrégations bien définies sont ce qui permet de fournir aux dirigeants les réponses explicables dont ils ont besoin.

Mercedes-Benz Korea et Databricks ont abordé ce projet ensemble. Plutôt que de traiter « Talk to Data » comme un simple projet de chatbot, Mercedes-Benz Korea a étendu sa base analytique existante avec une couche sémantique gouvernée pour l'IA d'entreprise. Pour activer une sémantique capable d'alimenter à la fois la BI et l'IA, Mercedes-Benz Korea a rendu la logique des KPI disponible dans Unity Catalog Business Semantics, en plus de Power BI. En s'appuyant sur Metric Views, Genie et Agent Bricks sur la Databricks Data Intelligence Platform, Mercedes-Benz Korea a piloté une architecture unifiée pour les données, la sémantique et l'IA agentique. Les enseignements tirés de ce projet pilote en Corée peuvent servir de référence pour d'autres marchés de Mercedes-Benz.

La vision de Mercedes-Benz Korea pour « Talk to Data » : une sémantique unifiée pour la BI et l'IA

Mercedes-Benz est un leader du marché dans le segment automobile de luxe haut de gamme, exploitant un réseau de vente mondial dans lequel la prise de décision basée sur les données et spécifique à chaque marché est une priorité constante. Les analyses en libre-service « Talk to Data » font partie des capacités explorées pour soutenir davantage cette priorité.

Mercedes-Benz Korea dispose d'une base de données mature. Au fil du temps, Mercedes-Benz Korea a établi des données de rapport de niveau « gold », un catalogue de KPI maître et des définitions partagées dans le Lakehouse et Unity Catalog sur Databricks. Cette base sert de source unique de vérité pour les rapports BI, l'automatisation et d'autres produits de données, couvrant plus de 500 KPI dans des domaines d'activité tels que les ventes, les produits, le marketing, le service client et la finance. Grâce à cette base solide, Mercedes-Benz Korea a été sélectionnée pour piloter l'approche « Talk to Data ».

Parallèlement, une part importante de la sémantique métier de Mercedes-Benz Korea était définie dans Power BI. Dans le cadre de la préparation aux cas d'usage de l'IA, ces définitions ont été complétées par une couche sémantique ouverte et prête pour l'IA dans le Lakehouse.

La vision plus large de Mercedes-Benz Korea pour « Talk to Data » était d'établir une base sémantique unifiée, prête pour l'IA et gouvernée pour la prise de décision en entreprise, capable de prendre en charge les rapports, les analyses en libre-service et les expériences d'IA sur un ensemble cohérent de définitions métier. Conformément à cette vision, Mercedes-Benz Korea n'a pas abordé « Talk to Data » comme une migration hors de Power BI, mais a poursuivi trois objectifs clés :

  • Un contexte cohérent pour l'IA : La logique métier et les KPI étaient déjà définis sur deux niveaux : dans le langage DAX de Power BI pour les rapports, et dans des tables « silver » et « gold » organisées dans le Lakehouse, prêtes à être consommées par l'IA. L'étape suivante consiste à déplacer le contexte sémantique des rapports BI vers Unity Catalog afin d'enrichir les produits de données existants dans le Lakehouse. Cela permet à Genie et à d'autres agents d'IA d'accéder à toutes les définitions de KPI en un seul endroit, de sorte que la même question, par exemple « Quel est le total de nos ventes au détail MTD par classe de véhicule ? », produise des réponses cohérentes à travers les différentes expériences d'IA.
  • Une architecture évoluant vers l'IA agentique : Mercedes-Benz Korea dispose d'une pile BI mature combinant Databricks pour l'ingénierie et l'entreposage de données avec Power BI pour la modélisation sémantique et les rapports. La prochaine étape de cette évolution consiste à l'étendre avec une couche sémantique unifiée et prête pour l'IA, basée sur la logique métier des rapports BI, afin que les outils BI en aval et les agents d'IA puissent fonctionner sur les mêmes KPI gouvernés.
  • Des utilisateurs de rapports aux agents basés sur des personas : La gouvernance pour les utilisateurs finaux au niveau des tables et des rapports était déjà en place dans le cadre de l'infrastructure de données existante. L'étape suivante consiste à étendre cette gouvernance avec un contrôle d'accès basé sur les personas dans Unity Catalog et des règles d'orchestration pour les agents de personas, afin que des rôles comme le CFO ou le Sales VP puissent bénéficier d'une expérience d'agent adaptée à leurs domaines sans modifier la sémantique métier sous-jacente.

Le respect de ces principes permet d'atteindre l'objectif selon lequel les futurs outils d'IA et de BI pourront consommer la même logique métier validée. Cela contribue à la cohérence, à l'explicabilité et à la qualité des réponses requises pour un usage en entreprise.

Une architecture unifiée pour les données, la sémantique et l'IA

image12.png

Pour activer une sémantique prête pour l'IA, Mercedes-Benz Korea a implémenté « Talk to Data » avec une architecture unifiée sur la Databricks Data Intelligence Platform, alimentant une IA de confiance à grande échelle.

La solution repose sur la collaboration de différentes fonctionnalités de Databricks :

  1. Lakeflow et le Lakehouse ingèrent les données d'entreprise provenant de divers systèmes sources et les préparent pour les charges de travail BI et IA.
  2. Les Unity Catalog business semantics servent de source unique de vérité pour les KPI, traduisant les mesures DAX de Power BI en vues métriques : les sources, les jointures, les mesures, les dimensions, les commentaires et les synonymes coexistent tous avec les données, gouvernés par les mêmes autorisations que les tables sous-jacentes.
  3. Les espaces Genie permettent aux équipes métier de « parler » à leurs données. Les espaces Genie sont organisés par domaine d'activité, chacun s'appuyant sur un ensemble de vues métriques sélectionnées. Comme les KPI des vues métriques sont définis directement sur les données de niveau « gold », Genie n'a pas besoin de faire de suppositions ou de jointures complexes pour trouver les bonnes réponses, ce qui augmente à la fois la rapidité et la précision de ses réponses.
  4. Agent Bricks compose des agents basés sur des personas au-dessus de plusieurs espaces Genie, de sorte que le CFO, le Sales VP et le responsable marketing bénéficient chacun d'une expérience « Talk to Data » adaptée à leur rôle.
  5. Databricks Apps fournit un front-end personnalisé, des connexions à des services externes et d'autres fonctionnalités étendues pour les agents composés, avec la mémoire et l'état stockés dans Lakebase.

Avant ce projet pilote, les données de rapport étaient stockées dans le metastore Hive, et « Talk to Data » était exploré avec d'autres solutions d'IA basées sur une sémantique centrée sur les rapports dans Power BI. Dans cette configuration, le contexte sémantique pour la BI et l'IA était réparti sur plusieurs composants, ce qui rendait plus difficile pour la couche d'IA de capturer la sémantique de manière cohérente entre les utilisateurs et les charges de travail. Le contrôle d'accès basé sur les personas pour les KPI n'était pas non plus disponible, et d'autres solutions d'IA nécessitaient des conseils plus explicites et un ajustement des prompts plus poussé que Genie, qui fonctionne directement sur la couche de KPI gouvernée dans Unity Catalog.

L'adoption de cette architecture sur Databricks jette les bases d'une expérience « Talk to Data » simplifiée pour les utilisateurs métier.

Accélérer le projet pilote : un transpileur automatisé de DAX vers des vues métriques (Metric Views)

image3.png

Le transpileur fonctionne comme un pipeline qui transforme les mesures DAX de Power BI en vues métriques Databricks déployables. Il :

  • Analyse les modèles sémantiques de Power BI et extrait chaque mesure DAX.
  • Crée un catalogue de métadonnées (telles que les tables de faits, les tables de dimensions, les relations de jointure, les clés de jointure, etc.) pour chaque mesure extraite des modèles sémantiques de Power BI.
  • Associe les tables sources de chaque mesure à leurs équivalents dans Unity Catalog.
  • Génère des projets de définitions de vues métriques (sources, jointures, dimensions, mesures), traduisant la sémantique DAX en mesures de vues métriques et en instructions SQL prêtes à l'emploi pour créer les vues métriques.
  • Signale les mesures non automatisables pour examen manuel, généralement celles impliquant des fonctionnalités complexes spécifiques à DAX comme la manipulation du contexte de ligne.
  • Valide la syntaxe et la logique d'agrégation avant de compiler les vues de métriques.
image9.png

Une fois le pipeline terminé, il génère un rapport d'évaluation contenant des statistiques de conversion, les écarts et des stratégies de remédiation pour la conversion des mesures DAX non automatisables.

Le résultat constitue un excellent point de départ avec des vues de métriques prêtes à l'emploi pour les mesures DAX automatisables, ce qui permet d'économiser des centaines d'heures de travail manuel sur la migration sémantique. À partir de là, l'équipe valide chaque mesure par rapport au rapport Power BI correspondant et effectue des itérations avec Genie Code, qui affine et optimise les définitions des vues de métriques à partir d'une saisie en langage naturel.

Après avoir constaté les premiers succès de ce transpileur, Databricks a intégré ces fonctionnalités dans une nouvelle compétence Genie Code pour la migration Power BI, actuellement en Private Preview et accessible directement dans Genie Code sans outil supplémentaire, soutenant ainsi la suite du déploiement chez Mercedes-Benz.

Bâtir une sémantique de confiance, prête pour l'AI

La qualité des réponses est une priorité absolue pour les utilisateurs métier de « Talk to Data » chez Mercedes-Benz Korea. L'intégration des KPI sous forme de vues de métriques dans les espaces Genie est une étape clé, mais elle ne garantit pas à elle seule des réponses fiables de la part d'une AI agentique. Une vue de métrique n'est prête pour l'AI que lorsque les réponses de Genie sont validées. L'objectif interne de Mercedes-Benz Korea est un alignement total des réponses de Genie avec les rapports Power BI correspondants — une correspondance à 100 % pour chaque KPI concerné.

Durant le projet pilote, Mercedes-Benz Korea et Databricks ont documenté conjointement les meilleures pratiques pour organiser, intégrer et optimiser les vues de métriques et les espaces Genie, y compris l'utilisation de métadonnées d'agent et de benchmarks. Ces pratiques favorisent une sémantique métier prête pour l'AI et des réponses cohérentes pour les équipes métier qui interagissent avec les données de l'entreprise.

En suivant un processus itératif en cinq phases documenté lors du pilote, Mercedes-Benz Korea a construit une sémantique métier prête pour l'AI sur la plateforme Databricks Data Intelligence Platform sur laquelle les utilisateurs métier peuvent s'appuyer. Databricks développe également une solution d'application pour automatiser ce processus, que Mercedes-Benz pourrait exploiter pour la suite du déploiement.

Phase 1 : Préparer. Sélectionnez les KPI à intégrer et associez chacun d'eux à ses tables sources dans Unity Catalog. Pour les migrations sémantiques Power BI, identifiez les mesures DAX et les modèles sémantiques pertinents. Cette phase établit le périmètre et la source unique de vérité.

Phase 2 : Construire la couche sémantique. Créez des vues de métriques Unity Catalog avec des sources de données, des dimensions, des mesures, des commentaires et des métadonnées d'agent. Validez chaque KPI individuellement avant d'ajouter le suivant. Pour les KPI qui s'étendent sur plusieurs tables de faits, créez d'abord une vue de base et superposez la vue de métrique par-dessus. Ajoutez toujours des descriptions au niveau de la vue de métrique, de la dimension et de la mesure ; Genie raisonne sur ces trois éléments.

Phase 3 : Organiser par domaine, pas par rapport. Structurez les espaces Genie autour des domaines métier (par exemple, « Marketing ») et les vues de métriques autour des groupes de KPI au sein des sous-domaines (par exemple, « Online Marketing Conversion Metrics »). Limitez chaque espace Genie à 30 éléments Unity Catalog, et incluez toujours une description de l'espace afin qu'un système multi-agent puisse orienter correctement les questions.

Phase 4 : Tester de manière incrémentielle. Intégrez les mesures de façon progressive. Validez chacune d'elles avec des questions types. Enregistrez les requêtes vérifiées en tant qu'exemples SQL. Ensuite, créez des benchmarks : des variations de formulation pour chaque question associées à un SQL de référence (ground-truth), utilisées pour mesurer systématiquement la précision des réponses. Activez la correspondance des prompts afin que Genie puisse associer le langage de l'utilisateur aux valeurs réelles des données.

Phase 5 : Valider et publier. Exécutez des tests de régression après chaque modification ; si un benchmark qui réussissait auparavant échoue, l'ajout le plus récent en est très probablement la cause. Une fois stable, déployez auprès d'un petit groupe d'utilisateurs métier pour obtenir des retours en conditions réelles. Utilisez l'onglet Monitor pour suivre, examiner et traiter tous les retours des utilisateurs au même endroit. Les échecs de régression et les retours des utilisateurs alimentent directement la phase 4.

Le résultat est une couche sémantique où les réponses de l'AI s'alignent sur le rapport BI correspondant pour chaque KPI concerné, offrant ainsi la fiabilité attendue par les utilisateurs métier.

D'un simple espace Genie à un système multi-agent avec gouvernance intégrée

Un seul espace Genie peut répondre à des questions sur un domaine unique. Une véritable expérience « Talk to Data » pour un marché Mercedes-Benz doit englober les ventes, les produits, le marketing, le service client, la finance et bien plus encore — tout en adaptant ce que chaque persona voit en fonction de son rôle et de ses autorisations.

image11.png

C'est là qu'intervient Agent Bricks. L'architecture déployée par Mercedes-Benz Korea :

  • Un agent superviseur parent oriente chaque question vers un agent persona avec des instructions spécifiques à son rôle.
  • L'agent persona (par exemple, « CFO », « responsable des ventes », « analyste marketing ») consolide les informations des espaces Genie appropriés dans les domaines pertinents, en sélectionnant le bon périmètre de vues de métriques pour répondre à la question.
  • Les politiques de gouvernance de Unity Catalog appliquent un accès au niveau des lignes et des colonnes, de sorte qu'un responsable régional ne voit que les données que son rôle lui autorise, même lorsqu'il pose des questions en langage naturel.
  • Les agents sont mis à disposition via Databricks Apps avec un front-end personnalisé et des fonctionnalités étendues telles que la visualisation personnalisée, la mémoire de l'agent et des bases de données transactionnelles sur Lakebase. L'application permet également d'intégrer les agents composés aux outils et services que les utilisateurs métier utilisent déjà, afin que « Talk to Data » s'intègre directement dans leur flux de travail quotidien plutôt que d'être une destination distincte.

Puisque les vues de métriques résident dans Unity Catalog, elles sont ouvertes et réutilisables dans l'ensemble des espaces Genie, des agents et des applications. Chaque réponse est entièrement gouvernée, auditable et suivie par lignage jusqu'aux données sources. Ce modèle multi-agent peut servir de référence pour déployer « Talk to Data » sur d'autres marchés de Mercedes-Benz.

Passer le pilote à l'échelle : un playbook reproductible pour les marchés mondiaux

La Corée n'en est qu'au début de cette aventure, et les premiers résultats sont encourageants. Le pilote actuel montre que lorsque « Talk to Data » repose sur une sémantique gouvernée, les utilisateurs métier peuvent obtenir des réponses alignées avec les définitions de KPI établies et la logique de reporting existante. Sur la base de ces résultats, Mercedes-Benz Korea a documenté un playbook que d'autres marchés peuvent réutiliser :image10.png

  1. Intégrez les données de marché provenant des systèmes sources mondiaux et locaux dans Unity Catalog.
  2. Construisez des pipelines Lakeflow Spark Declarative Pipelines pour organiser les données de reporting de la couche gold.
  3. Établissez la qualité des données et la documentation des KPI au niveau de la couche gold.
  4. Exécutez le transpileur DAX-to-Metric-View pour générer des ébauches de modèles sémantiques.
  5. Validez les vues de métriques par rapport au catalogue Master KPI de Mercedes-Benz.
  6. Construisez, testez et optimisez les espaces Genie en utilisant le processus en cinq phases ci-dessus.
  7. Déployez des agents persona avec Agent Bricks par-dessus Genie et Unity Catalog.
  8. Intégrez des agents personnalisés dans Databricks Apps ou des outils tiers, là où l'utilisateur travaille déjà.

Les marchés qui choisissent d'adopter le playbook peuvent réutiliser l'architecture et se concentrer sur ce qui leur est propre : leurs données, leurs KPI et leurs agents AI. En collaboration avec Databricks, Mercedes-Benz Korea documente les enseignements tirés du pilote « Talk to Data » afin qu'ils puissent servir de référence pour d'autres marchés de Mercedes-Benz.

Pour commencer

(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original

Recevez les derniers articles dans votre boîte mail

Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.