Revenir au contenu principal

Qu'est-ce que l'analytique IA ? Pourquoi elle ne fonctionne que sur des données gouvernées

Richard Tomlinson, directeur du marketing produit chez Databricks, explique pourquoi la confiance dans l'analyse par IA est une propriété du système, et non du modèle, et ce qu'il faut pour transformer des données gouvernées en décisions.

par Richard Tomlinson

  • L'analyse par IA ne se résume pas à de la BI avec un chatbot greffé dessus. Elle déplace la charge du travail analytique, passant d'un humain naviguant dans des tableaux de bord à un système capable de comprendre l'intention, d'enquêter et, de plus en plus, d'agir de manière autonome.
  • Une analyse par IA digne de confiance repose sur quatre piliers : des données gouvernées, un contexte métier partagé, une exécution respectueuse des autorisations et des preuves vérifiables. De meilleurs modèles seuls ne suffisent pas.
  • Les définitions métier fragmentées ont toujours été un problème pour la BI. L'IA en fait un problème encore plus grand, car le système doit désormais résoudre lui-même les désaccords organisationnels, et une réponse erronée peut sembler tout à fait plausible.

L'analyse AI est la pratique consistant à appliquer l'intelligence artificielle et le machine learning à l'analyse de données, permettant aux systèmes de faire émerger des modèles, de générer des insights et de répondre à des questions en langage naturel sans création manuelle de requêtes. Elle fait passer l'analyse de tableaux de bord rétrospectifs à des flux de travail automatisés, conversationnels et prédictifs sur lesquels un plus grand nombre d'utilisateurs métier peuvent agir directement.

Aujourd'hui, n'importe quel fournisseur de BI peut faire la démonstration d'une requête en langage naturel. Posez une question, obtenez un graphique, faites bonne impression en réunion. La question la plus difficile, celle qui distingue une plateforme de référence d'une simple bonne démonstration, est de savoir ce qui se passe lorsque ce même système est confronté à une véritable entreprise : des définitions de métriques contradictoires, cinq tables qui pourraient plausiblement répondre à la question, et un utilisateur qui, techniquement, ne devrait pas voir la moitié des données sous-jacentes.

Richard Tomlinson dirige le marketing produit pour les produits de business intelligence et d'analyse de Databricks. Dans cette conversation, nous avons abordé ce qui change lorsque la BI devient nativement AI, pourquoi la gouvernance s'avère plus importante avec l'AI et non moins, et ce qu'un responsable des données devrait demander aux fournisseurs plutôt que de s'enquérir du modèle de fondation qu'ils utilisent.

En quoi l'analyse AI diffère-t-elle de la BI traditionnelle ?

La BI a toujours été capable de vous dire ce qui s'est passé. Qu'est-ce qui change réellement avec l'analyse AI, et pourquoi est-ce bien plus qu'une simple BI sur laquelle on a greffé un chatbot ?

Richard Tomlinson : Une bonne BI a toujours aidé à comprendre plus que ce qui s'est simplement passé. La véritable limite est que la BI traditionnelle exige généralement qu'un humain trace le chemin analytique. Quelqu'un doit décider quel tableau de bord ouvrir, quels filtres appliquer, dans quelles dimensions explorer, quelle requête de suivi exécuter, et souvent quand faire appel à un analyste.

L'analyse AI change la donne quant à la personne qui effectue ce travail. Au lieu de présenter une vue prédéfinie des données, un système alimenté par l'AI peut comprendre l'intention derrière une question métier, déterminer quelles données et quel contexte métier sont pertinents, générer et exécuter les requêtes nécessaires, et de plus en plus mener une investigation en plusieurs étapes pour le compte de l'utilisateur.

C'est sur ce dernier point que l'analyse agentielle devient importante. Si je demande : « Pourquoi la marge a-t-elle chuté dans le Nord-Est au trimestre dernier ? », un système agentiel n'a pas besoin de traduire cela en une seule requête SQL et de renvoyer un graphique. Il peut formuler des hypothèses, étudier la gamme de produits, les remises, les segments de clientèle ou les coûts, tirer des enseignements de chaque résultat et synthétiser les preuves en une explication.

L'évolution se résume donc ainsi :

  • Tableaux de bord : montrez-moi ce que nous avons déjà décidé de mesurer.
  • Analyse conversationnelle : permettez-moi de poser une nouvelle question.
  • Analyse agentielle : étudiez la question pour moi.

C'est un changement bien plus fondamental que d'ajouter une boîte de discussion à un tableau de bord.

Si les tableaux de bord montrent ce qui s'est passé, que révèle cette investigation ? Qu'est-ce que l'analyse alimentée par l'AI peut apprendre à un décideur qu'un tableau de bord ne pourrait jamais lui révéler ?

Richard Tomlinson : Le plus grand changement est le passage de l'observation à l'investigation. Un tableau de bord peut indiquer à un détaillant que la marge brute a baissé de trois points. C'est utile, mais cela laisse toujours le décideur se demander pourquoi.

Un système alimenté par l'AI peut chercher à savoir si la baisse est concentrée sur des magasins, des produits ou des segments de clientèle particuliers, tester si les remises ont changé, déterminer si la gamme de produits a évolué, comparer le calendrier avec les promotions ou les changements de fournisseurs, et synthétiser ces résultats en une explication. Le résultat de valeur n'est pas un autre graphique. Ce serait plutôt quelque chose comme : la marge est en baisse principalement parce qu'une proportion plus élevée de ventes s'est déplacée vers deux catégories de produits fortement remisées dans le Nord-Est, tandis que le volume unitaire et l'acquisition sont restés stables. C'est beaucoup plus proche des informations dont une décision a réellement besoin.

Je décrirais la progression ainsi : que s'est-il passé, qu'est-ce qui a changé, pourquoi cela a-t-il changé, que dois-je étudier ou décider ensuite. Et je n'irais pas jusqu'à insinuer que chaque système d'analyse AI peut prendre ou exécuter la décision de manière autonome. Le progrès significatif à court terme consiste à réduire considérablement le travail analytique requis pour passer d'un signal à une décision bien étayée.

Que signifie pour l'AI d'interpréter les données de manière sémantique ?

Vous avez parlé de l'analyse AI qui interprète les données de manière sémantique. Qu'est-ce que cela signifie en pratique ?

Richard Tomlinson : L'analyse AI interroge absolument toujours les données. La différence est qu'elle doit comprendre ce que les données signifient avant de décider comment les interroger.

Une base de données peut indiquer à un système AI qu'il existe une colonne appelée net_rev, une autre appelée bookings, et une relation entre deux tables. Elle ne peut pas lui dire ce que l'entreprise entend par « chiffre d'affaires », si les dirigeants utilisent le chiffre d'affaires réservé ou comptabilisé, quel calendrier fiscal s'applique, quelle hiérarchie de clients fait foi, ou si les commandes annulées doivent être incluses. Ce sont des questions sémantiques. Elles représentent le sens métier qui se situe entre le langage de l'utilisateur et les données physiques.

En pratique, un système d'analyse AI robuste a besoin de définitions gouvernées des métriques et des KPIs, des dimensions et des relations entre les entités métier, de la terminologie et des synonymes utilisés par l'entreprise, des règles métier et de la logique de calcul, des sources faisant foi, des autorisations et de la gouvernance, et souvent des connaissances institutionnelles issues de la façon dont les utilisateurs ont historiquement exploité les données. C'est ce contexte qui permet au système de traduire « Comment se déroulent les renouvellements d'entreprise ? » dans la bonne interprétation d'entreprise, de renouvellement et de déroulement avant même de construire une requête.

C'est pourquoi la sémantique devient plus importante avec l'AI, et non moins.

Comment rendre fiables les analyses générées par l'AI ?

Si un responsable des données vous demandait de but en blanc : « comment rendre fiables les analyses générées par l'AI ? », quelle serait votre réponse honnête ?

Richard Tomlinson : Ne commencez pas par le modèle. Commencez par le socle sur lequel le modèle est autorisé à raisonner. Je pense que la fiabilité de l'analyse AI repose sur quatre piliers.

Premièrement, des données fiables : l'AI a besoin d'un accès gouverné aux mêmes données d'entreprise que celles auxquelles vous feriez confiance pour un rapport de direction, et non à des copies exportées dans un environnement AI distinct. Deuxièmement, un contexte métier fiable : des définitions partagées pour les métriques, les entités et la terminologie qui comptent pour l'entreprise. Donner un schéma de base de données à un LLM ne revient pas à lui apprendre comment fonctionne l'entreprise. Troisièmement, une exécution fiable : la gouvernance et les autorisations doivent s'appliquer de l'utilisateur jusqu'aux données. Un système AI ne doit pas contourner les contrôles d'accès existants simplement parce que quelqu'un a posé une question en langage naturel. Quatrièmement, la vérifiabilité : les utilisateurs et les équipes de données ont besoin de preuves qu'ils peuvent inspecter, des données sources, des calculs ou des requêtes derrière la réponse, de citations le cas échéant, et d'un moyen d'évaluer systématiquement les réponses par rapport à des questions de référence éprouvées.

Ce dernier point est encore plus important à mesure que l'analyse devient agentielle. Une seule mauvaise requête produit une seule réponse erronée. Un agent peut prendre plusieurs décisions analytiques au cours d'une investigation, vous avez donc besoin de mécanismes pour ancrer et valider l'ensemble de ce processus, et pas seulement le résultat final.

L'idée clé est que la confiance est une propriété du système, pas du modèle. Un LLM plus performant ne suffit pas à lui seul à rendre fiables les analyses d'entreprise.

Pourquoi cela s'effondre-t-il lorsque ce n'est pas ancré dans des données gouvernées ? Qu'est-ce qui ne va pas, concrètement ?

Richard Tomlinson : J'apporterais une nuance ici : la gouvernance est nécessaire, mais elle ne suffit pas à elle seule. Vous pouvez avoir des données parfaitement gouvernées et obtenir tout de même une réponse erronée formulée avec assurance si l'AI ne comprend pas ce que ces données signifient.

Sans un socle gouverné, plusieurs choses peuvent mal tourner à la fois. Le système peut sélectionner une table obsolète au lieu de celle certifiée. Deux utilisateurs peuvent obtenir des réponses calculées à partir de versions différentes du même KPI. Des informations sensibles peuvent être exposées à quelqu'un qui ne devrait pas les voir. Et lorsqu'une réponse semble fausse, l'équipe de données peut n'avoir aucun moyen fiable de retracer quelle donnée ou quel calcul l'a produite.

L'AI amplifies ces problèmes car elle élargit considérablement le cercle des personnes pouvant interroger les données et le nombre de questions pouvant être posées. Auparavant, une ambiguïté aurait pu amener un analyste à demander des clarifications. Un système AI peut à la place formuler une hypothèse plausible et continuer avec assurance.

La base a donc besoin de gouvernance et de sémantique : le contrôle des données utilisables et des personnes autorisées à y accéder, ainsi qu'une compréhension partagée de la signification de ces données. Le but n'est pas simplement d'éviter les hallucinations. Il s'agit de s'assurer que les analyses générées par l'AI fonctionnent selon les mêmes définitions, autorisations et normes de preuve que l'organisation attend déjà des analyses générées par des humains.

Que se passe-t-il lorsque les équipes définissent la même métrique différemment ?

De nombreuses organisations ont des définitions métier différentes qui coexistent dans différents outils de BI. Quel est le risque une fois que l'AI entre en jeu, et comment un responsable des données devrait-il envisager de standardiser ces définitions ?

Richard Tomlinson : L'AI transforme un problème de BI de longue date en un problème bien plus vaste. Les organisations ont toujours été confrontées à des définitions concurrentes de notions telles que le chiffre d'affaires, le client actif, le churn ou la conversion. Avec les tableaux de bord, ces incohérences sont au moins relativement circonscrites. La finance a son tableau de bord, les ventes en ont un autre, et les utilisateurs finissent par savoir lequel utiliser.

AI élimine ces frontières. Un utilisateur demande simplement : « Quel était le chiffre d'affaires le trimestre dernier ? » L'AI doit maintenant décider quelle définition, quel ensemble de données et quel calcul représentent l'intention de l'organisation. Si ces définitions sont fragmentées entre différents outils de BI, modèles sémantiques et tableaux de bord, on demande en réalité à l'AI de résoudre seule un désaccord organisationnel. C'est dangereux, car la réponse peut tout de même sembler tout à fait plausible.

La solution n'est pas nécessairement un unique modèle sémantique gigantesque qui tente de décrire l'ensemble de l'entreprise. Il s'agit plutôt de déplacer la signification métier critique vers des définitions sémantiques partagées et gouvernées, qui résident à proximité des données sous-jacentes et sont réutilisables à travers les expériences analytiques et d'AI. Cela devient encore plus important à mesure que les entreprises déploient davantage d'agents d'AI. Vous ne voulez pas que chaque tableau de bord, copilote et agent apprenne de manière indépendante ce que signifie le « chiffre d'affaires net ». Vous voulez qu'ils s'appuient tous sur le même contexte métier partagé.

C'est l'un des plus grands changements architecturaux que l'AI apporte à l'analytique : la sémantique ne peut plus résider exclusivement dans la couche de présentation.

Rapport

Le guide pratique de l'IA agentique pour l'entreprise

Pourquoi les utilisateurs ont-ils besoin de voir comment une AI est parvenue à sa réponse ?

Au-delà de la précision, pourquoi est-il important qu'un utilisateur métier puisse voir comment l'AI est parvenue à une réponse, et pas seulement la réponse elle-même ?

Richard Tomlinson : Parce que l'analytique ne consiste pas seulement à obtenir une réponse, mais à disposer de suffisamment de preuves pour prendre une décision à partir de cette réponse. Si une AI indique à un responsable des ventes que l'attrition des clients de l'entreprise a augmenté de 14 %, les questions suivantes qui viennent naturellement sont : par rapport à quelle période, quels clients sont inclus, comment l'attrition est-elle définie, quelles données soutiennent cette conclusion et puis-je les explorer en détail ? Un système digne de confiance devrait permettre de répondre à ces questions.

Je serais précis sur ce que signifie « montrer comment l'AI y est parvenue ». Cela ne signifie pas exposer le raisonnement privé ou le cheminement de pensée du modèle. Ce dont les utilisateurs ont besoin, c'est de provenance et de preuves : les sources de données utilisées, les calculs ou requêtes exécutés, les citations pertinentes, les tableaux et visualisations à l'appui, ainsi que les hypothèses qui affectent matériellement le résultat.

Cela importe encore plus avec l'analytique agentique. Si un agent réalise une enquête en dix étapes, l'utilisateur ne devrait pas avoir à croire aveuglément le paragraphe final. Il devrait pouvoir inspecter les preuves qui sous-tendent les conclusions importantes. La transparence modifie également le comportement des utilisateurs. Elle transforme l'AI d'un oracle en un partenaire analytique. Les gens peuvent contester une réponse, pousser l'investigation plus loin et décider par eux-mêmes si les preuves sont assez solides pour agir.

Comment un système d'analyse par AI décide-t-il de la source de données à laquelle faire confiance ?

Lorsqu'il existe plusieurs réponses ou sources plausibles, comment votre AI sait-elle à quoi faire confiance ?

Richard Tomlinson : Presque tous les fournisseurs peuvent présenter une démonstration impressionnante en langage naturel. Le plus difficile est de savoir ce qui se passe lorsque l'environnement réel de l'entreprise est complexe. Que se passe-t-il si la Finance et les Ventes calculent le chiffre d'affaires différemment ? S'il existe cinq tableaux capables de répondre à la question ? Si une source est certifiée et qu'une autre a été créée hier ? Si la personne qui pose la question n'a l'autorisation de voir qu'une partie des données sous-jacentes ?

Le fournisseur devrait être en mesure d'expliquer comment son système comprend les définitions métier, détermine l'autorité des sources, applique les autorisations des utilisateurs, gère l'ambiguïté et présente des preuves pour la réponse obtenue. Si la réponse est essentiellement « le LLM s'en charge », je serais très prudent. Pour les systèmes agentiques, cela devient un problème encore plus important, car le système ne prend pas une seule décision de récupération, il peut prendre des dizaines de décisions sur les données à examiner et l'hypothèse à poursuivre.

Cette question est bien plus révélatrice de la capacité d'une plateforme d'analyse par AI à survivre à la confrontation avec la réalité d'une entreprise que le simple fait de savoir sur quel modèle de fondation elle repose.

Les meilleurs modèles d'AI éliminent-ils le besoin de contexte métier ?

Quelle est la croyance actuelle de la plupart des responsables des données concernant l'analytique par AI que vous jugez erronée ou exagérée ?

Richard Tomlinson : La plus grande idée reçue est que de meilleurs modèles d'AI élimineront le besoin de modéliser et de structurer le contexte métier. C'est tout le contraire qui se produit. Les LLM sont remarquablement doués pour comprendre le langage et raisonner sur les informations, mais ils ne peuvent pas déduire avec certitude les définitions métier privées d'une organisation. Ils ne savent pas intrinsèquement lequel de vos de cinq calculs de chiffre d'affaires le CFO considère comme faisant autorité, ce que signifie « client actif » dans votre entreprise, ou à quel ensemble de données il faut faire confiance pour une réunion du conseil d'administration. À mesure que l'AI devient plus performante et plus autonome, ce contexte gagne en importance, car l'AI prend davantage de décisions au nom de l'utilisateur.

Une deuxième idée reçue est que l'AI rend les tableaux de bord obsolètes. Je ne le pense pas. Les tableaux de bord restent extrêmement efficaces lorsque vous savez ce que vous voulez suivre : chiffre d'affaires, pipeline, utilisation, attrition, stocks, niveaux de service. L'AI devient particulièrement puissante lorsque la question n'est pas déjà intégrée dans le tableau de bord, notamment lorsque quelqu'un demande pourquoi, souhaite explorer un changement inattendu ou a besoin d'une investigation couvrant plusieurs dimensions.

L'avenir de la BI ne réside pas dans le chat au détriment des tableaux de bord. C'est un continuum dans lequel les tableaux de bord traitent les questions connues, l'analytique conversationnelle gère les questions ad hoc, et les agents prennent de plus en plus en charge les enquêtes complexes. C'est une définition plus crédible de la prochaine génération de BI que le simple remplacement de chaque tableau de bord par un chatbot.

L'analytique par AI ne supprime pas le travail difficile de la BI, elle le déplace

Le fil conducteur de tout cela est que l'analytique par AI ne supprime pas le travail difficile de la BI, elle le déplace. Le travail consistant à définir des métriques, à gouverner les accès et à s'accorder sur la signification du « chiffre d'affaires » ne disparaît pas lorsque vous ajoutez une interface en langage naturel. Il devient plus important, car le système procède désormais à des arbitrages qu'un analyste humain effectuait auparavant, à une échelle qu'aucune équipe d'analystes ne pourrait égaler.

Pour les responsables des données qui évaluent des plateformes axées sur l'AI, la question n'est pas de savoir si la démo est séduisante. Il s'agit de savoir si le système sous-jacent, les données gouvernées, la sémantique partagée, l'exécution respectueuse des autorisations et les preuves vérifiables ont été conçus pour résister à la réalité complexe d'une entreprise. C'est ce socle qui transforme l'analytique par AI, passant d'un moteur de requête impressionnant à un outil digne de confiance pour éclairer les décisions.

Découvrez comment les tableaux de bord alimentés par l'AI et l'analytique conversationnelle fonctionnent directement sur des données gouvernées. Explorez Databricks AI/BI

(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original

Recevez les derniers articles dans votre boîte mail

Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.