Au-delà du modèle sémantique : bâtir un contexte métier partagé pour les agents IA
Les grands modèles de langage savent raisonner, mais ils ne connaissent pas votre entreprise. Donner à l'IA d'entreprise le contexte métier dont elle a besoin ne se limite pas à la connecter aux données. Les agents doivent également comprendre vos définitions, vos relations, vos règles métier, vos sources de référence et vos autorisations. Genie Ontology comble cette lacune en combinant la sémantique métier modélisée avec le contexte extrait des tables gouvernées, des requêtes, des tableaux de bord, des notebooks et d'autres ressources prises en charge que vos équipes utilisent déjà. Genie classe ce contexte par autorité et pertinence, applique les autorisations et fournit le contexte le plus utile à Genie au moment de répondre. Les agents externes peuvent également accéder à l'intelligence de Genie via MCP.
Un bon modèle sémantique fournit un noyau de référence. Les modèles sémantiques capturent les concepts métier que vous définissez délibérément ; une ontologie étend cette base avec les relations, les connaissances et le contexte plus larges dont l'IA a besoin pour comprendre comment l'entreprise fonctionne réellement. Dans le jargon Databricks, Unity Catalog Semantics combine les Metric Views, les Pages et les Domains pour établir vos définitions métier de confiance. Genie Ontology s'appuie ensuite sur ce noyau modélisé en y intégrant le contexte déduit de vos ressources existantes, offrant ainsi aux agents une compréhension de l'entreprise bien plus large qu'un simple modèle sémantique.
La clé consiste à modéliser la « tête » et à laisser Genie Ontology déduire la « queue ». Genie s'appuie sur ce qu'il peut apprendre automatiquement dès le premier jour, tandis qu'une curation délibérée permet d'améliorer les définitions et les sources critiques qui doivent être exactes.
Les six couches suivantes sont des pratiques progressives visant à renforcer la confiance au fil du temps, et non des prérequis pour que Genie commence à apporter de la valeur.

Examinons chaque couche de plus près pour mieux comprendre.
Couche 0 : Établir des bases de données solides pour les agents
Avant de décrire ou de modéliser quoi que ce soit, les données sous-jacentes doivent être structurées de manière à ce qu'un agent puisse raisonner dessus. Cette couche concerne les fondations physiques : des tables de données propres, des schémas solides et une identité unique et cohérente pour chaque entité du monde réel. La modélisation logique des processus métier intervient plus tard, à la couche 2. Cette étape est facile à ignorer, mais coûteuse à corriger par la suite, car aucune quantité de métadonnées de qualité ou de modélisation sémantique ne peut compenser des fondations physiques défaillantes.
Poser des bases de données solides implique de se concentrer sur deux domaines clés :
- Modéliser la couche "gold" durable autour des processus métier. Cela implique d'identifier les faits avec une granularité claire et des dimensions conformes et réutilisables. Un schéma en étoile ou un modèle hybride vous offre une base fiable de faits et de dimensions sans avoir à copier la logique métier dans chaque table en aval. Cela ne signifie pas pour autant que les agents doivent raisonner sur des tables de dimensions brutes. L'interface vue par un agent peut être plus restreinte, et devrait souvent l'être : une Metric View ou une vue dédiée qui pré-joint les dimensions communes pour un domaine, n'expose que les champs importants, documente la granularité et définit ses mesures de manière canonique. C'est exactement ce que vous construirez à la couche 2. L'objectif est de structurer délibérément la surface de consommation au-dessus d'un modèle solide, plutôt que de livrer un agent à un flux de données brut. Une table large n'est pas le problème. Une table large avec des granularités mixtes, des concepts métier dupliqués et aucune définition de métrique canonique est une invitation à l'erreur.
- Résoudre les entités en enregistrements de référence (golden records). Si le terme « client » désigne les comptes actifs dans l'équipe commerciale et absolument tous les comptes dans l'équipe d'assistance, un agent ne saura pas à quelle définition se fier. Si le même client possède trois identifiants différents selon les systèmes, il risque également d'être comptabilisé plusieurs fois. Rapprochez la même entité du monde réel à travers les différentes sources afin qu'un client unique corresponde bien à un seul client.

Couche 1 : Enrichir vos métadonnées
Les métadonnées constituent le socle descriptif qui aide à la fois la couche sémantique et l'extraction de contexte à comprendre vos données. Lorsqu'une table est nommée fct_rev_daily et qu'une colonne est nommée rev_amt, un agent doit deviner leur signification. Lorsque cette même table comporte une description indiquant « chiffre d'affaires quotidien comptabilisé, net des remboursements, par produit » et que la colonne contient un commentaire indiquant « chiffre d'affaires comptabilisé en USD », l'agent dispose d'éléments concrets pour raisonner. De bonnes descriptions représentent l'un des investissements les plus rentables et les moins coûteux que vous puissiez faire, et elles améliorent tous les outils en aval, pas seulement Genie.
Voici trois étapes essentielles à suivre.
- Ajouter des descriptions de table et des commentaires de colonne dans Unity Catalog. Rédigez-les à l'intention d'un nouvel analyste qui ne connaît pas votre schéma : expliquez ce que représentent les données, quel est leur but métier et signalez toute mise en garde connue. Concentrez vos efforts là où ils sont les plus rentables, sur les tables préparées et prêtes pour l'entreprise que les tableaux de bord et les agents interrogent réellement.
- Appliquer des étiquettes (tags) pour classer et organiser. Les descriptions fournissent le sens narratif ; les étiquettes fournissent des signaux structurés pour la classification, la découverte et la gouvernance. Utilisez-les pour indiquer la sensibilité (PII, PHI, PCI), la propriété, la fonction métier et d'autres attributs qui doivent être compris de manière cohérente dans l'ensemble du patrimoine de données. Les étiquettes gouvernées permettent aux administrateurs de définir un ensemble approuvé de clés et de valeurs afin que la classification reste cohérente au lieu de dériver d'une équipe à l'autre. Ces signaux peuvent également alimenter ultérieurement les politiques d'accès et d'autres contrôles de gouvernance.
- Automatiser la première passe lorsque le volume rend le travail manuel peu pratique. Le Databricks Solution Accelerator, dbxmetagen, utilise de grands modèles de langage pour générer des descriptions, détecter et étiqueter les données sensibles, et proposer classifications. Rien n'est écrit dans Unity Catalog avant qu'un humain ne l'ait examiné et approuvé, ce qui permet d'accélérer le travail plutôt que de remplacer le jugement humain.

Couche 2 : Modéliser l'activité avec une couche sémantique
Les métadonnées expliquent les tables individuelles. La couche sémantique définit la logique métier supérieure, de sorte que les métriques les plus importantes signifient la même chose partout où elles sont utilisées. Là où la couche 0 a établi les fondations physiques, cette couche crée le modèle logique : mesures, relations, domaines et termes.
Voici quatre étapes importantes :
- Déclarer vos relations. Les agents effectuent des jointures de tables pour répondre aux questions, et s'ils doivent deviner comment les tables sont connectées, ils se tromperont parfois. Déclarer les clés primaires et étrangères dans Unity Catalog indique aux agents comment les tables sont liées, afin qu'ils effectuent les jointures correctement au lieu d'inventer des chemins. Ces contraintes sont informatives plutôt qu'imposées, votre processus de gouvernance doit donc veiller à leur exactitude, mais les déclarer est l'un des moyens les plus directs de réduire les erreurs de jointure. Les relations font tout autant partie du modèle que les métriques elles-mêmes.
- Bâtir un modèle sémantique à l'aide de Metric Views. Une Metric View est un objet Unity Catalog qui définit vos mesures (les nombres agrégés, comme le chiffre d'affaires total) et vos dimensions (les façons de les segmenter, comme la région ou le mois) une seule fois, sous forme de code gouverné. L'agrégation étant résolue au moment de la requête plutôt qu'intégrée de manière figée, les utilisateurs qui interrogent la Metric View utilisent la même définition gouvernée. C'est l'une des étapes les plus importantes pour garantir la précision, car elle élimine l'ambiguïté qui pousse les agents à choisir la mauvaise définition. Définissez d'abord vos KPI critiques en tant que Metric Views : ce sont les chiffres qui ne doivent absolument pas être erronés, comme le chiffre d'affaires, les clients actifs et les mesures de conformité clés.
- Ajouter des métadonnées orientées agent à vos métriques. Les Metric Views peuvent comporter des noms d'affichage et des synonymes, de sorte que le langage naturel comme « ventes » soit associé à la bonne mesure, ainsi que des modèles de format pour les devises et les dates, et des exemples de requêtes. Ces métadonnées sont intégrées à Genie Ontology, de sorte que le travail que vous effectuez pour modéliser une métrique permet également à un agent de la trouver et de l'utiliser plus facilement et correctement.
- Organiser et documenter. Les domaines et sous-domaines Unity Catalog regroupent les ressources dans des collections alignées sur l'activité afin que le contexte reste délimité. Cela améliore la rapidité et la précision de Genie, car il peut concentrer sa recherche sur les ressources des domaines d'activité pertinents plutôt que de chercher dans l'ensemble du patrimoine de données. Les pages Unity Catalog capturent les termes métier, concepts et définitions partagés que les utilisateurs métier et les agents utilisent pour raisonner. Chaque page répertorie les ressources de référence liées à ce concept. Ainsi, lorsque l'ontologie résout un terme issu d'une question, elle sait déjà sur quelles tables, Metric Views et requêtes s'appuyer, plutôt que de chercher dans tout le patrimoine et de deviner. La révision par les propriétaires garantit la fiabilité de ces définitions. Comme elles sont affirmées et révisées par des humains, elles ont plus d'autorité que le contexte déduit lorsque l'ontologie doit résoudre un conflit.

Automatiser la modélisation sémantique avec Genie Code
Bien entendu, le processus de modélisation sémantique n'a pas besoin d'être entièrement manuel. Vous pouvez utiliser Genie Code pour créer et maintenir des Metric Views à l'aide d'instructions en langage naturel. Dans l'invite de Genie Code, décrivez les tables sources, les jointures, les champs, les mesures et les filtres, et il génère le YAML que vous pouvez réviser avant de l'enregistrer. Vous pouvez également utiliser la compétence /importBI dans Genie Code pour importer des modèles sémantiques Tableau ou Power BI. Genie Code crée alors une Metric View, que vous pouvez ensuite promouvoir dans Unity Catalog pour sa réutilisation, sa gouvernance, son lignage et sa découvrabilité.

Genie Code peut également rédiger des brouillons de pages. Dans l'éditeur de pages, sélectionnez un domaine, joignez les fichiers, liens, ressources Unity Catalog ou contenus connectés via MCP pertinents, et Genie Code rédigera les champs structurés et le corps de la page en texte enrichi. Examinez le brouillon, ajoutez les sources et ressources associées appropriées, puis enregistrez-le ou publiez-le. Pour plusieurs concepts, utilisez l'importation groupée de pages. Genie Code extrait et déduplique les pages proposées à partir de vos documents et sources, signale les conflits, les doublons et les termes à faible niveau de confiance pour révision, et crée les pages approuvées sous forme de brouillons pour modification et publication ultérieures.
Couche 3 : Organiser des ressources riches en contexte
La partie déduite de l'ontologie apprend des ressources que vos équipes produisent déjà, comme les tableaux de bord, les notebooks, les requêtes SQL, les Genie Agents et la documentation. Plus votre patrimoine de données est riche et fiable, plus le contexte déduit devient utile. La couche 3 consiste à faire en sorte que ces ressources valent la peine d'être exploitées pour l'apprentissage.
Voici quatre étapes essentielles :
- Créer une base de ressources riche et largement utilisée. Un espace de travail contenant de nombreux tableaux de bord, requêtes et Genie Agents bien documentés et largement utilisés fournit à l'ontologie plus de matière pour apprendre qu'un espace de travail peu fourni. À mesure que ces ressources sont utilisées et améliorées, les signaux disponibles pour l'extraction de contexte s'enrichissent.
- Rendre vos ressources riches en contexte. Plus une ressource est riche, plus l'ontologie peut en tirer des enseignements. Lorsque vous enrichissez un Genie Agent avec des définitions, des exemples et des instructions, vous obtenez non seulement un agent plus performant, mais vous donnez également à Genie Ontology un contexte plus solide à extraire et à classer dans l'ensemble du patrimoine. Faites de même pour vos autres ressources : documentez les notebooks avec des cellules Markdown, les requêtes SQL enregistrées avec des commentaires, et les tableaux de bord AI/BI avec des descriptions et des annotations. Ensemble, ces éléments fournissent les connaissances métier riches et spécifiques sur lesquelles s'appuie Genie Ontology.
- Certifier les ressources de confiance. La certification marque vos ressources de données et d'IA (telles que les Metric Views, les Genie Agents ou les Notebooks) comme validées et approuvées, et sert de signal fort pour déterminer quelles sources font autorité. Les ressources certifiées et largement utilisées ont plus d'autorité que celles non vérifiées. Ainsi, certifier vos ressources de confiance influence directement le contexte qui l'emporte en cas de conflit. Déprécier les ressources obsolètes est l'autre volet de cette démarche : cela permet d'éloigner les utilisateurs et les agents des contenus que vous ne soutenez plus.
- Classifier les données sensibles et surveiller la qualité. La classification des données identifie et étiquette les données sensibles afin qu'elles puissent être gouvernées de manière cohérente, et la surveillance de la qualité des données détecte les dérives et les anomalies avant qu'elles n'affectent les personnes et les agents qui en dépendent. Ces deux aspects permettent de s'assurer que les ressources qui alimentent l'ontologie sont fiables.

Couche 4 : Construire la couche de gouvernance
La gouvernance est ce qui rend les réponses de Genie sécurisées et fiables. Puisque les autorisations déterminent le contexte que Genie Ontology peut récupérer, deux personnes peuvent poser la même question et obtenir des réponses différentes en fonction de ce qu'elles sont autorisées à voir.
Examinons la gouvernance dans trois domaines spécifiques :
- Commencer par les contrôles d'accès de Unity Catalog. Le modèle de privilèges de Unity Catalog en est la base. Il contrôle l'accès aux catalogues, schémas, tables et autres ressources de l'espace de travail, et Genie Ontology respecte ces autorisations. Genie utilise uniquement le contenu que la personne qui pose la question est autorisée à voir. Ainsi, des questions identiques peuvent produire des réponses différentes selon l'utilisateur. Gérer l'accès par le biais de groupes plutôt que d'individus facilite la maintenance des autorisations à mesure que vous évoluez.
- Ajouter des contrôles précis là où les données l'exigent. Pour les données sensibles, la sécurité au niveau des lignes restreint les lignes qu'un utilisateur peut voir, et le masquage des colonnes masque les valeurs sensibles. Les deux sont appliqués au moment de la requête. Le contrôle d'accès basé sur les attributs vous permet de gérer ces protections à partir d'étiquettes gouvernées. Ainsi, une politique liée à une étiquette de sensibilité s'applique partout où cette étiquette apparaît, plutôt que d'être définie table par table. Cela offre un moyen évolutif d'appliquer de manière cohérente la protection au niveau des lignes et des colonnes sur un vaste patrimoine de données.
- Gouverner la couche d'IA. Unity AI Gateway offre aux administrateurs un espace centralisé pour gérer l'accès aux modèles, les limites de taux, la journalisation des charges utiles et le contrôle des coûts pour les charges de travail d'IA, ainsi que des contrôles de sécurité et de données sensibles sur ce qui est envoyé aux modèles. C'est le point de contrôle pour gouverner le comportement de l'agent et ses dépenses à mesure que l'utilisation augmente.
Ensemble, ces contrôles déterminent le contexte que l'ontologie peut récupérer et les utilisateurs qui peuvent le recevoir. Le contenu non autorisé ne participe pas à la récupération, il ne peut donc pas influencer indirectement une réponse.

Couche 5 : Évaluer et améliorer
Les cinq premières couches construisent le contexte métier que Genie utilise pour répondre aux questions. La couche d'évaluation et d'amélioration maintient la précision de ce contexte à mesure que l'activité évolue. Les métriques sont redéfinies, les tables deviennent obsolètes et de nouveaux produits sont introduits. Mesurer régulièrement la qualité des réponses aide à identifier le moment où l'ontologie doit s'adapter, avant que des réponses obsolètes ou incorrectes n'altèrent la confiance des utilisateurs.
Il y a quatre domaines clés à prendre en compte :
- Valider l'expérience avant le déploiement. Commencez par un ensemble représentatif de questions métier pour chaque domaine prioritaire. Définissez la réponse attendue, la source de référence et les critères d'acceptation pour chaque question. Testez ensuite ces questions dans Genie One, en vous assurant qu'elles sollicitent les Metric Views, les pages, les Genie Agents, les tableaux de bord, les requêtes et les autres sources dont dépendront les utilisateurs. Les Genie Agent Benchmarks offrent un moyen intégré d'évaluer un Genie Agent individuel au fil du temps. En mode Chat, les benchmarks peuvent comparer les résultats à des réponses SQL validées ; en mode Agent, les réponses sont évaluées à l'aide d'un juge LLM et de critères d'évaluation facultatifs. Pour Genie One et, plus largement, Genie Ontology, votre équipe doit définir et s'approprier l'ensemble de questions, la vérité de terrain (ground truth), la validation des sources, le processus de révision manuelle et les seuils d'acceptation. Lorsqu'une réponse échoue, remontez jusqu'à la source ou au contexte sous-jacent et corrigez la cause racine. Cela peut impliquer de définir une logique de métrique gouvernée dans une Metric View, de clarifier une définition métier dans une page, d'améliorer les métadonnées Unity Catalog, de certifier ou de déprécier une ressource, ou d'affiner la préparation d'un Genie Agent spécifique à un domaine.
- Surveillez les réponses, l'utilisation et la qualité des sources. Utilisez la fonctionnalité de surveillance des ressources exploitées par Genie Ontology. Genie Agent Monitor offre une visibilité sur les questions, les réponses, les retours, les réponses signalées et les tendances d'utilisation de chaque Agent. Dans Genie One, les citations de sources aident les utilisateurs et les administrateurs à inspecter quelles sources de l'Ontology ont contribué à une réponse. L'historique des requêtes (Query History), les journaux d'audit et les tables système de facturation peuvent offrir une visibilité supplémentaire sur l'exécution SQL, les événements et l'utilisation.
- Bouclez la boucle de rétroaction au bon niveau. Capturez les retours des utilisateurs et les demandes d'examen, puis orientez le problème vers la ressource responsable de la réponse. La correction doit être apportée là où réside la signification métier :
- Une Page, lorsque le problème concerne une définition métier ou un synonyme.
- Une Metric View, lorsque le problème concerne une mesure, une dimension, une relation ou un calcul gouvernés.
- Les métadonnées, les autorisations, la certification ou l'obsolescence de Unity Catalog, lorsque le problème provient d'une ressource source.
- Les instructions d'un Genie Agent, les exemples SQL, les expressions SQL, les réponses approuvées ou le Knowledge Store, lorsque le problème est spécifique au domaine de cet Agent. Les Genie Agents disposent de plusieurs fonctionnalités intégrées pour capturer les retours des utilisateurs et y donner suite, notamment les pouces levés et pouces baissés, la demande d'examen, l'inspection du SQL généré, l'ajout en tant qu'instruction et l'ajout en tant que benchmark.
- Surveillez la dérive de vos ressources. La dérive peut se produire à de nombreux endroits : définitions métier, logique des KPI, métadonnées des tables, jointures, tableaux de bord, notebooks, pipelines, instructions des Genie Agents et modèles d'utilisation des sources. Établissez des propriétaires et un rythme de révision pour les ressources de chaque domaine critique. Pour remédier à la dérive, appuyez-vous sur le modèle que vous avez déjà construit : les Pages pour les concepts de référence, les Metric Views pour les mesures et dimensions gouvernées, les Domains pour l'organisation et la gérance, et la certification ou l'obsolescence pour marquer ce qui est recommandé ou obsolète. Maintenez à jour les tables sources, les vues, les tableaux de bord, les notebooks et les requêtes, car ils alimentent tous le contexte déduit, et utilisez les autorisations pour éloigner le contenu expérimental ou retiré des personnes et des agents qui ne devraient pas le voir. Pour les Genie Agents, réexécutez leurs suites de benchmarks après des modifications substantielles de leurs données, instructions, exemples ou ressources approuvées.

L'évaluation n'est pas une étape de validation unique avant le lancement ; c'est une habitude continue pour chaque ressource qui alimente une réponse. Databricks vous fournit les ressources sémantiques gouvernées, la recherche d'ontologie et les citations, l'évaluation et la surveillance au niveau de l'Agent, ainsi que la télémétrie des tables système. Vous apportez la vérité terrain (ground truth), la responsabilité, le processus de révision et la maintenance récurrente qui permettent de préserver la fiabilité de Genie.
Commencez par un domaine, puis étendez-le
L'un des points clés à retenir est que vous n'avez pas besoin de construire les six niveaux à la fois. Vous ne devriez pas essayer de couvrir l'ensemble de l'entreprise avant la mise en production. La voie la plus pratique consiste simplement à commencer à utiliser Genie, puis à choisir un domaine à forte valeur ajoutée et à renforcer délibérément les définitions, les sources, la gouvernance et l'évaluation qui comptent le plus. Il s'agit d'une approche de type « apprendre et étendre » plutôt que de chercher à tout faire à la fois.
Choisissez ce premier domaine de manière délibérée. Commencez par un flux de travail récurrent et complexe où les équipes passent déjà du temps à rapprocher les chiffres manuellement, comme une réunion de prévision ou un cycle de planification. C'est là qu'une réponse fiable a le plus de valeur, et où vous savez déjà à quoi ressemble un résultat correct. En pratique, commencez par un périmètre restreint : choisissez un domaine comme les Ventes (Sales) et une métrique comme l'ARR, puis consolidez l'essentiel. Certifiez la métrique critique, définissez les termes importants, identifiez les ressources de référence, gouvernez les accès et évaluez les questions qui comptent. Utilisez les résultats pour guider le domaine suivant.
Ce dernier point est plus important qu'il n'y paraît. L'objectif de ces pratiques n'est pas l'exhaustivité technique pour elle-même ; c'est la confiance : savoir si un utilisateur métier croit suffisamment en une réponse pour agir en conséquence. Chaque niveau permet de gagner un peu de cette confiance, et la boucle d'évaluation rend cette confiance visible et justifiable, plutôt qu'une simple question d'opinion.
Deux éléments se renforcent mutuellement au fil du temps. Chaque entité résolue, ressource documentée, métrique certifiée, définition de page de glossaire et jeu de données gouverné renforce le cœur de référence. Et chaque interaction peut révéler des retours que les équipes utilisent pour l'améliorer. Le résultat est une compréhension métier partagée qui s'améliore à l'usage plutôt que de se détériorer.
L'opérationnalisation de Genie Ontology n'est pas un mégaprojet de modélisation. Il s'agit d'un investissement régulier et progressif dans votre modèle de données, vos métadonnées, votre sémantique métier, votre contexte d'entreprise, votre gouvernance et votre évaluation, déployé un domaine à la fois, qui donne à l'AI une réelle compréhension de votre entreprise.
En savoir plus
Si vous souhaitez en savoir plus, lisez le blog d'annonce de Genie Ontology et visitez les pages web de Genie One et des Genie Agents. Consultez également la page web Unity Catalog Semantics pour en savoir plus sur les Metric Views. Nous commençons à peine à entrevoir ce qui devient possible lorsque l'AI peut s'appuyer sur une compréhension partagée et fiable de l'entreprise. Nous avons hâte de voir comment nos clients utiliseront Genie Ontology pour prendre des décisions plus rapides, agir avec une plus grande confiance et créer de nouvelles méthodes de travail.
(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original