Ir al contenido principal

Ontología de datos definida: la capa de contexto que les falta a tus agentes de AI

Richard Tomlinson, Director de Marketing de Producto de Databricks, explica por qué el término "ontología" se está redefiniendo en tiempo real y por qué la brecha que llena es lo único que se interpone entre un agente de AI y una respuesta confiable.

por Richard Tomlinson

  • La arquitectura de datos empresarial siempre ha asumido que un humano experto se encuentra entre los datos y la decisión, aportando el contexto que un esquema no puede ofrecer. Los agentes de AI eliminan a ese humano, y esa suposición deja de ser válida.
  • Las capas semánticas y los grafos de conocimiento intentaron resolver esto antes y a menudo quedaron en desuso, porque modelar toda una empresa a mano no puede seguir el ritmo de la rapidez con la que cambia un negocio.
  • La solución no es un proyecto de documentación más grande. Es una ontología que rige el pequeño conjunto de conceptos que no pueden estar equivocados y aprende continuamente el resto a partir de cómo ya funciona la organización, el modelo que Databricks ha integrado en Genie Ontology.

Pregunte a cinco personas de la misma empresa qué significa "ingresos" y es probable que obtenga cinco respuestas diferentes, cada una correcta en su propio contexto e incompatible con las demás. Mientras un analista humano se ha interpuesto entre esa ambigüedad y el informe final, la ambigüedad ha sido manejable. Es conocimiento tribal: el tipo de cosas que un buen analista simplemente sabe.

Los agentes de AI no lo saben. Y ese es el problema.

Richard Tomlinson ha pasado su carrera pensando en la capa de datos empresariales que nunca llega a aparecer en el esquema. En esta conversación, explica por qué esa capa, la ontología, es de repente la pieza de infraestructura más importante que la mayoría de las empresas aún no han creado, por qué la última generación de intentos para construirla se estancó en gran medida y qué debe cumplirse en una ontología para que se sostenga una vez que los agentes comiencen a confiar en ella.

¿Por qué los agentes de AI necesitan un contexto empresarial que un esquema no puede proporcionar?

¿Cuál es la suposición sobre los datos empresariales que los agentes de AI están rompiendo silenciosamente?

Richard Tomlinson: Durante décadas, la arquitectura de datos empresariales ha funcionado bajo una suposición implícita: si se organizan los datos correctamente, un usuario inteligente puede descifrar lo que significan. Las tablas, los esquemas, los catálogos y los paneles de control proporcionan estructura, mientras que los humanos aportan el contexto que falta. Un analista sabe en cuál de las cinco tablas de ingresos confía el departamento de Finanzas, qué significa "cliente activo" este trimestre o por qué se debe utilizar un cálculo en lugar de otro.

Los agentes de AI rompen esa suposición porque puede que no haya ningún humano experto entre los datos y la decisión. El agente tiene que descubrir el significado por sí mismo. Darle a un agente acceso a más datos no resuelve esto. Necesita el contexto empresarial que los humanos históricamente han llevado en sus cabezas: definiciones, relaciones, cálculos, fuentes autorizadas, experiencia y permisos. Por eso el contexto empresarial se está volviendo tan importante para la arquitectura de AI como los propios datos.

¿Qué es una ontología de datos y en qué se diferencia de un esquema?

¿Cómo se define una ontología de datos y qué captura que un esquema nunca podría?

Richard Tomlinson: Un esquema describe cómo se estructuran los datos. Una ontología describe lo que significan esos datos en el contexto del negocio. Conecta activos técnicos como tablas, métricas y consultas con conceptos empresariales: definiciones, relaciones, cálculos, fuentes de experiencia y reglas sobre cómo deben interpretarse esos conceptos.

Un esquema podría decirle a un agente que una tabla contiene net_rev, gross_rev y recog_rev. Una ontología puede ayudarle a comprender qué definición de ingresos se aplica a la pregunta, qué fuente considera autorizada el departamento de Finanzas, cómo se realiza normalmente el cálculo y si la persona que pregunta tiene permiso para acceder a ella. El esquema es el mapa de los datos. El ontología se acerca más a un mapa de cómo la organización entiende y utiliza esos datos.

¿Por qué las capas semánticas y los gráficos de conocimiento tuvieron dificultades para escalar?

Las capas semánticas y los gráficos de conocimiento empresarial prometieron "una única versión de la verdad" hace años y, en su mayoría, se convirtieron en software sin usar. ¿Qué debe cumplirse en una ontología para que no sufra el mismo destino?

Richard Tomlinson: Suavizaría un poco esa premisa. Las capas semánticas y los gráficos de conocimiento han aportado un valor real, especialmente para conceptos críticos para el negocio. El problema surge cuando las organizaciones intentan modelar manualmente toda la empresa. El conocimiento empresarial cambia demasiado rápido y está disperso en demasiados lugares. La lógica importante puede estar en un panel de control, una consulta SQL, un cuaderno, un ticket o simplemente en la forma en que un equipo trabaja habitualmente. Ningún equipo centralizado puede documentar todo eso y mantenerlo actualizado.

El modelo más escalable es “modelar la cabeza y aprender la cola”. Los humanos deben definir y gobernar explícitamente el pequeño conjunto de conceptos que no pueden estar equivocados, cosas como los ingresos, las reglas de cumplimiento y los KPI principales. La ontología más amplia debería aprender continuamente la cola larga a partir de cómo opera la organización, al mismo tiempo que clasifica el conocimiento por autoridad y respeta la gobernanza. Si el mantenimiento de la ontología se convierte en un proyecto independiente de modelado de datos empresariales, eventualmente se quedará atrás con respecto al negocio que se supone que debe describir.

¿Qué sucede cuando un agente de AI carece de contexto empresarial?

¿Can you describe a moment where an agent gave a confident, wrong answer because it lacked real business context? What made it convincing enough that someone almost trusted it?

Richard Tomlinson: Un ejemplo de nuestras propias pruebas internas fue pedir a varios sistemas de AI que prepararan un informe para un próximo Consejo Asesor de Productos. Un asistente produjo un informe muy bien elaborado casi de inmediato y afirmó que participaban 24 clientes. Incluía el tipo de detalles que se esperarían en un informe ejecutivo, por lo que, a primera vista, la respuesta parecía creíble. Cuando desafiamos al sistema a explicar de dónde venía el número 24, admitió que lo había inventado.

Ese es el peligroso modo de fallo. La respuesta no es obviamente absurda. Es fluida, específica y se presenta junto con información legítima. El problema es que el modelo no sabe qué fuente interna contiene la verdad absoluta, por lo que llena el vacío con inferencias. En la AI empresarial, una respuesta plausible puede ser más peligrosa que ninguna respuesta.

¿Cómo puede saber si a su organización le falta una capa de contexto?

Si un líder de datos quisiera saber si su propia organización tiene este problema, ¿qué debería buscar? ¿Hay algún indicio que señale que falta la capa de contexto?

Richard Tomlinson: La señal más clara es la frecuencia con la que una pregunta comercial sencilla requiere que una persona experta la traduzca antes de que los datos puedan responderla. Si alguien pregunta: "¿Cuáles fueron los ingresos el trimestre pasado?" y el analista responde inmediatamente con "¿Qué ingresos?" o "¿Para qué unidad de negocio?", ese paso de traducción es el contexto empresarial. Lo mismo ocurre cuando los analistas saben en qué panel de control confiar, qué tabla está obsoleta o qué definición utiliza un equipo frente a otro.

Otros indicios: paneles de control duplicados, definiciones de KPI en conflicto, analistas que responden repetidamente a las mismas preguntas y usuarios de negocio que desconfían del autoservicio porque diferentes herramientas devuelven respuestas distintas. El problema de fondo a menudo no es que la empresa carezca de datos. Es que el conocimiento necesario para interpretar los datos reside en el conocimiento tribal, en artefactos desconectados y en expertos individuales, en lugar de en una capa de contexto que la AI pueda utilizar de forma fiable.

Informe

La guía de IA agéntica para la empresa

¿Cuánto les cuesta hoy en día a las empresas la falta de contexto empresarial?

¿Cuánto les está costando esto a las empresas hoy en día, incluso antes de haber implementado agentes a escala? ¿Se trata de decisiones más lentas, trabajo de analistas duplicado, pérdida de confianza en los paneles de control?

Richard Tomlinson: Todo lo anterior. Las organizaciones ya pagan un "impuesto de contexto". Los analistas pasan tiempo redescubriendo definiciones, localizando fuentes autorizadas, conciliando informes en conflicto y explicando la lógica empresarial que existe en algún otro lugar de la organización. Diferentes equipos recrean la misma semántica dentro de diferentes herramientas de BI. Los usuarios de negocio esperan a los analistas porque el autoservicio deja de funcionar tan pronto como la pregunta adquiere matices.

La AI hace que este problema existente sea más visible. Sin contexto, los agentes repiten gran parte del mismo proceso de descubrimiento de forma computacional: explorando esquemas, leyendo documentos, probando consultas y reconsiderando suposiciones. Eso genera latencia adicional, consumo de tokens y costes sin garantizar la respuesta correcta. Sin embargo, el mayor coste es la confianza. Una vez que los usuarios descubren que un panel de control o un asistente de AI puede generar con seguridad un número incorrecto, vuelven a preguntar a un humano.

¿Qué cambia cuando se puede confiar en que los agentes de AI actúen, no solo que informen?

¿Qué cambia para una empresa en el momento en que se puede confiar en que sus agentes actúen, no solo que informen?

Richard Tomlinson: El valor de la AI cambia drásticamente. Los informes le ahorran a alguien el tiempo necesario para encontrar una respuesta. La acción de confianza puede eliminar pasos enteros de un flujo de trabajo. Un agente puede calcular las últimas cifras, preparar la revisión comercial semanal, investigar una anomalía, actualizar un ticket, contactar a las personas adecuadas y repetir ese proceso todos los lunes sin que alguien tenga que coordinar cada paso manualmente.

Eso también cambia la economía de la experiencia. Un experto en finanzas, un gerente de producto o un líder de operaciones pueden codificar métodos críticos una vez y combinarlos con un agente que comprenda el contexto empresarial más amplio. Su experiencia se puede aplicar a muchas más decisiones y flujos de trabajo de los que esa persona podría respaldar personalmente. El calificativo clave es "de confianza": la autonomía solo se vuelve útil cuando el agente comprende el negocio lo suficientemente bien, y está gobernado con la suficiente rigidez, como para actuar dentro de los límites adecuados.

¿Cuál es la forma correcta de empezar a construir una ontología de datos?

¿Cuál es la forma incorrecta de empezar, el instinto que conduce a otra iniciativa de software sin usar, frente al primer paso correcto?

Richard Tomlinson: El instinto equivocado es: "Antes de que podamos usar la AI, necesitamos modelar toda la empresa". Eso convierte el contexto empresarial en un proyecto de documentación de varios años. Para cuando se ha modelado cada término, relación y regla, gran parte del modelo ya está desactualizado.

El mejor enfoque es comenzar con el conocimiento que ya tiene. Gobierne el pequeño número de conceptos que realmente no pueden estar equivocados, como los KPI críticos y las definiciones de negocio, y luego deje que la capa de contexto más amplia aprenda de los dashboards, consultas, notebooks, documentos y la actividad operativa que sus equipos ya están produciendo. No exija que la empresa lo documente todo antes de que la AI pueda ser útil. Permita que el uso real ayude a construir y mejorar continuamente la comprensión del negocio que consumen los agentes.

¿Cómo deberían los líderes de datos replantearse la arquitectura de datos para los agentes de AI?

¿Cómo debería un líder de datos pensar de manera diferente sobre su arquitectura de datos ahora que el contexto, y no solo la estructura, es lo que realmente vale la pena invertir?

Richard Tomlinson: Durante años, la arquitectura de datos se centró en gran medida en hacer que los datos fueran accesibles, confiables y gobernados. Esos aspectos siguen siendo esenciales, pero la AI añade otro requisito: la arquitectura también debe hacer accesible el significado empresarial. Un agente necesita saber no solo dónde residen los datos, sino también cómo los interpreta la organización, qué relaciones importan, qué definiciones son autoritativas y qué evidencia las respalda.

Eso significa que los activos que antes se consideraban principalmente como infraestructura de gobernanza o analítica se convierten en activos estratégicos de AI. Las definiciones de métricas, la documentación, el linaje, las certificaciones, los patrones de uso y los glosarios de negocio enseñan colectivamente a la AI cómo funciona la empresa. Por lo tanto, la arquitectura emergente no es solo un plano de datos más un modelo de AI. También necesita una capa de contexto compartida que pueda ofrecer la misma comprensión del negocio a muchos agentes y aplicaciones.

¿Realmente mejora la ontología de datos la precisión del agente?

Richard Tomlinson: Una ontología por sí sola no hace que un agente sea preciso por arte de magia. Lo que mejora la precisión es proporcionar al agente el contexto adecuado y autoritativo en el momento en que está razonando. Si la ontología puede decirle al agente qué definición se aplica, dónde residen los datos de confianza y qué relaciones o cálculos importan, el agente pasa menos tiempo adivinando y explorando caminos incorrectos.

Tenemos evidencia de ese efecto con Genie Ontology, la capa de contexto automática debajo de Genie One y Genie Agents de Databricks. En una evaluación comparativa interna de Databricks que utilizó 28 preguntas de análisis de datos empresariales del mundo real, Genie con Ontology respondió correctamente el 84.5% en el primer intento. El agente de codificación de propósito general más sólido en la misma evaluación obtuvo un 52.4%. Genie también fue aproximadamente el doble de rápido que ese agente. Esa es una evaluación comparativa interna en lugar de una garantía de precisión universal, pero ilustra el principio fundamental: un mejor contexto empresarial puede importar tanto o más que simplemente darle al modelo más tiempo para razonar.

¿Es necesario construir una ontología formal desde cero?

Richard Tomlinson: No, y exigir eso recrearía el problema de escalabilidad que estamos intentando resolver. La mayoría de las empresas ya han creado una gran cantidad de su comprensión del negocio. Existe en definiciones de métricas, datos certificados, dashboards, consultas, notebooks, documentación y en las formas repetidas en que los equipos utilizan esos activos.

El objetivo debe ser preservar el control humano sobre los conceptos que más importan, al tiempo que se aprende automáticamente gran parte de la cola larga. Con Genie Ontology, eso significa modelar explícitamente los KPI críticos y los términos comerciales, mientras que la capa inferida aprende definiciones, reglas, relaciones y fuentes autoritativas adicionales a partir del trabajo existente. Obtiene valor del conocimiento que la organización ya tiene, en lugar de esperar a que finalice un proyecto de ontología independiente.

¿Qué papel juega la gobernanza en un agente de AI basado en ontologías?

¿Cómo encaja la gobernanza en un agente basado en ontologías?

Richard Tomlinson: La gobernanza tiene dos tareas. La obvia es el acceso: la ontología nunca debería convertirse en una puerta trasera para eludir los permisos existentes. Si un usuario no puede acceder a la información de origen, el agente no debería poder recuperar el contexto derivado de ella. Con Genie Ontology, los permisos se aplican durante la recuperación, utilizando la gobernanza de las fuentes subyacentes, incluido Unity Catalog. Por lo tanto, dos empleados pueden hacer la misma pregunta y recibir de manera adecuada respuestas diferentes según lo que cada uno esté autorizado a ver.

La segunda tarea es igual de importante: la gobernanza ayuda a la AI a comprender en qué confiar. La certificación, las definiciones autoritativas, el linaje, el uso, la experiencia y la procedencia de las fuentes se convierten en señales que ayudan a distinguir la definición oficial de ingresos de un cálculo único que alguien creó hace seis meses. En la era de la AI, la gobernanza ya no se trata solo de controlar los datos. Es, cada vez más, parte del mecanismo que enseña a la AI qué conocimiento empresarial merece autoridad.

¿Por qué la ontología de datos se está convirtiendo en infraestructura de AI?

La palabra "ontología" solía pertenecer a los equipos de modelado semántico y a los debates sobre taxonomía. Rápidamente se está convirtiendo en algo más cercano a la infraestructura: la capa que decide si la respuesta de un agente refleja cómo funciona realmente el negocio, o simplemente una suposición plausible disfrazada de tal. Las organizaciones que tratan el contexto como algo que debe gobernarse y aprenderse continuamente, y no como algo que se documenta una vez y se deja obsoleta, serán aquellas en cuyos agentes se pueda confiar para actuar, no solo para informar.

Vea cómo la ontología de Genie fundamenta las respuestas de AI en lo que realmente significa su negocio. Explore Genie.

Lea a continuación:

(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original

Recibe las últimas publicaciones en tu bandeja de entrada

Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.