Más allá del modelo semántico: Construcción de un contexto de negocio compartido para agentes de AI
Los modelos de lenguaje grande saben cómo razonar, pero no conocen tu negocio. Dar a la AI empresarial el contexto de negocio que necesita significa más que simplemente conectarla a los datos. Los agentes también necesitan comprender tus definiciones, relaciones, reglas de negocio, fuentes autorizadas y permisos. Genie Ontology cierra esa brecha al combinar la semántica de negocio modelada con el contexto aprendido de las tablas gobernadas, consultas, dashboards, notebooks y otros activos compatibles que tus equipos ya utilizan. Genie clasifica ese contexto por autoridad y relevancia, aplica permisos y entrega el contexto más útil a Genie al momento de responder. Los agentes externos también pueden acceder a la inteligencia de Genie a través de MCP.
Un buen modelo semántico proporciona un núcleo autorizado. Los modelos semánticos capturan los conceptos de negocio que defines deliberadamente; una ontología amplía esa base con las relaciones, el conocimiento y el contexto más amplios que la AI necesita para comprender cómo opera realmente el negocio. En el lenguaje de Databricks, Unity Catalog Semantics combina Metric Views, Pages y Domains para establecer tus definiciones de negocio de confianza. Luego, Genie Ontology se basa en ese núcleo modelado al incorporar el contexto inferido de tus activos existentes, lo que brinda a los agentes una comprensión mucho más amplia del negocio de la que podría proporcionar un modelo semántico por sí solo.
La clave es modelar la “cabeza” y dejar que Genie Ontology infiera la “cola”. Genie trabaja a partir de lo que puede aprender automáticamente desde el primer día, mientras que la curación deliberada mejora las definiciones y fuentes críticas que deben ser correctas.
Las siguientes seis capas son prácticas progresivas para aumentar la confianza a lo largo del tiempo, no requisitos previos para que Genie comience a aportar valor.

Analicemos cada capa para comprenderla en mayor profundidad.
Capa 0: Establece una base de datos sólida para los agentes
Antes de describir o modelar cualquier cosa, los datos subyacentes deben tener una forma sobre la cual un agente pueda razonar. Esta capa se centra en la base física: tablas de datos limpias, esquemas sólidos y una identidad coherente por cada entidad del mundo real. El modelado lógico de negocio viene más adelante, en la Capa 2. Esta capa es fácil de omitir y costosa de corregir más adelante, porque ninguna cantidad de buenos metadatos o modelado semántico puede compensar una base física defectuosa.
Establecer una base de datos sólida significa centrarse en dos áreas clave:
- Modelar la capa gold duradera en torno a los procesos de negocio. Esto incluye identificar hechos con una granularidad clara y dimensiones conformadas y reutilizables. Un esquema en estrella o un modelo híbrido te brinda una base confiable de hechos y dimensiones sin tener que copiar la lógica de negocio en cada tabla aguas abajo. Eso no significa que los agentes deban razonar sobre tablas dimensionales sin procesar. La interfaz que ve un agente puede ser más acotada, y a menudo debería serlo: una Metric View o una vista diseñada específicamente que combine previamente las dimensiones comunes para un dominio, exponga solo los campos que importan, documente la granularidad y defina sus medidas de forma canónica. Construirás exactamente eso en la Capa 2. El objetivo es dar forma deliberadamente a la superficie de consumo sobre un modelo sólido, en lugar de lanzar a un agente a un volcado de datos. Una tabla ancha no es el problema. Una tabla ancha con granularidades mixtas, conceptos de negocio duplicados y sin definiciones de métricas canónicas es una invitación a la adivinación.
- Resolver entidades en registros golden. Si "cliente" significa cuentas activas en Ventas y absolutamente todas las cuentas en Soporte, un agente no sabrá en qué definición confiar. Si el mismo cliente tiene tres IDs diferentes en todos los sistemas, también se puede duplicar su conteo. Concilia la misma entidad del mundo real entre las distintas fuentes para que un cliente sea un solo cliente.

Capa 1: Enriquece tus metadatos
Los metadatos son la base descriptiva que ayuda tanto a la capa semántica como a la extracción de contexto a comprender tus datos. Cuando una tabla se llama fct_rev_daily y una columna se llama rev_amt, un agente tiene que adivinar qué significan. Cuando la misma tabla lleva una descripción que dice "ingresos diarios reconocidos, netos de reembolsos, por producto" y la columna tiene un comentario que dice "ingresos reconocidos en USD", el agente tiene algo real sobre lo cual razonar. Las buenas descripciones son una de las inversiones de mayor rendimiento y menor costo que puedes realizar, y mejoran cada herramienta aguas abajo, no solo Genie.
Aquí tienes tres pasos esenciales que debes seguir.
- Añadir descripciones de tablas y comentarios de columnas en Unity Catalog. Escribe para un nuevo analista que no conozca tu esquema: di qué representan los datos, cuál es su propósito de negocio y señala cualquier advertencia conocida. Concentra el esfuerzo donde realmente rinda frutos: en las tablas seleccionadas y listas para el negocio que los dashboards y los agentes realmente consultan.
- Aplicar etiquetas para clasificar y organizar. Las descripciones proporcionan el significado narrativo; las etiquetas proporcionan señales estructuradas para la clasificación, el descubrimiento y la gobernanza. Úsalas para capturar la confidencialidad (PII, PHI, PCI), la propiedad, la función de negocio y otros atributos que deben entenderse de manera coherente en todo el patrimonio de datos. Las etiquetas gobernadas permiten a los administradores definir un conjunto aprobado de claves y valores para que la clasificación siga siendo coherente en lugar de variar de un equipo a otro. Estas señales también pueden incorporarse a las políticas de acceso y otros controles de gobernanza más adelante.
- Automatizar la primera pasada cuando el volumen haga que el trabajo manual no sea práctico. El Databricks Solution Accelerator, dbxmetagen, utiliza modelos de lenguaje grande para generar descripciones, detectar y etiquetar datos confidenciales y proponer clasificaciones. No se escribe nada en Unity Catalog hasta que un humano lo revise y lo apruebe, por lo que acelera el trabajo en lugar de reemplazar el criterio humano.

Capa 2: Modela el negocio con una capa semántica
Los metadatos explican tablas individuales. La capa semántica define la lógica de negocio por encima, de modo que las métricas más importantes signifiquen lo mismo en todos los lugares donde se utilicen. Mientras que la Capa 0 estableció la base física, esta capa crea el modelo lógico: medidas, relaciones, dominios y términos.
Aquí tienes cuatro pasos importantes:
- Declarar tus relaciones. Los agentes unen tablas para responder preguntas y, si tienen que adivinar cómo se conectan las tablas, a veces se equivocarán. Declarar claves primarias y foráneas en Unity Catalog les indica a los agentes cómo se relacionan las tablas, de modo que realicen las uniones correctamente en lugar de inventar rutas. Estas restricciones son informativas en lugar de obligatorias, por lo que tu proceso de gobernanza debe mantenerlas precisas, pero declararlas es una de las formas más directas de reducir los errores de unión. Las relaciones son una parte tan importante del modelo como las propias métricas.
- Construir un modelo semántico utilizando Metric Views. Una Metric View es un objeto de Unity Catalog que define tus medidas (los números agregados, como los ingresos totales) y dimensiones (las formas en que los desglosas, como la región o el mes) una sola vez, como código gobernado. Debido a que la agregación se resuelve en el momento de la consulta en lugar de estar integrada, los consumidores que consultan la Metric View utilizan la misma definición gobernada. Este es uno de los pasos más importantes para la precisión porque elimina la ambigüedad que hace que los agentes elijan la definición incorrecta. Define primero tus KPI críticos como Metric Views: estos son los números que absolutamente no pueden estar mal, como los ingresos, los clientes activos y las medidas de cumplimiento principales.
- Añadir metadatos orientados al agente a tus métricas. Las Metric Views pueden incluir nombres para mostrar y sinónimos, de modo que el lenguaje natural como "ventas" se asocie con la medida correcta, patrones de formato para monedas y fechas, y consultas de ejemplo. Estos metadatos fluyen hacia Genie Ontology, por lo que el trabajo que realizas para modelar una métrica también facilita que un agente la encuentre y la utilice correctamente.
- Organizar y documentar. Los dominios y subdominios de Unity Catalog agrupan los activos en colecciones alineadas con el negocio para que el contexto se mantenga acotado. Esto mejora la velocidad y la precisión de Genie, ya que puede centrar su descubrimiento en los activos dentro de las áreas de negocio relevantes en lugar de buscar en todo el patrimonio de datos. Las páginas de Unity Catalog capturan los términos, conceptos y definiciones comerciales compartidos que los usuarios y agentes de negocio utilizan para razonar. Cada página enumera los activos autoritativos vinculados a ese concepto, de modo que cuando la ontología resuelve un término de una pregunta, ya sabe a qué tablas, Metric Views y consultas recurrir en lugar de buscar en todo el patrimonio y adivinar. La revisión por parte del propietario mantiene la confiabilidad de estas definiciones y, al ser afirmadas y revisadas por humanos, tienen más autoridad que el contexto inferido cuando la ontología tiene que resolver un conflicto.

Automatización del modelado semántico con Genie Code
Por supuesto, el proceso de modelado semántico no tiene por qué ser un esfuerzo puramente manual. Puede aprovechar Genie Code para crear y mantener Metric Views utilizando instrucciones en lenguaje natural. En el prompt de Genie Code, describa las tablas de origen, las uniones (joins), los campos, las medidas y los filtros, y este generará el YAML para que lo revise antes de guardarlo.

Genie Code también puede redactar borradores de páginas. En el editor de páginas, seleccione un dominio, adjunte archivos relevantes, enlaces, activos de Unity Catalog o contenido conectado a MCP, y Genie Code redactará los campos estructurados y el cuerpo de la página en texto enriquecido. Revise el borrador, agregue las fuentes y los activos relacionados adecuados, y luego guárdelo o publíquelo. Para varios conceptos, utilice la opción de importación masiva de páginas. Genie Code extrae y elimina los duplicados de las páginas propuestas a partir de sus documentos y fuentes, marca los conflictos, duplicados y términos de baja confianza para su revisión, y crea las páginas aprobadas como borradores para su posterior edición y publicación.
Capa 3: Curar activos ricos en contexto
La parte inferida de la ontología aprende de los activos que sus equipos ya producen, como paneles (dashboards), notebooks, consultas SQL, agentes de Genie y documentación. Cuanto más rico y confiable sea su patrimonio de datos, más útil será el contexto inferido. La Capa 3 consiste en hacer que valga la pena aprender de esos activos.
Aquí tiene cuatro pasos esenciales:
- Construir una base de activos sólida y muy utilizada. Un espacio de trabajo con muchos paneles, consultas y agentes de Genie bien documentados y ampliamente utilizados ofrece a la ontología más material del cual aprender que uno con pocos elementos. A medida que esos activos se utilizan y mejoran, las señales disponibles para la extracción de contexto se vuelven más ricas.
- Hacer que sus activos sean ricos en contexto. Cuanto más rico sea un activo, más podrá aprender la ontología de él. Al enriquecer un agente de Genie con definiciones, ejemplos e instrucciones, no solo obtiene un agente con mejor rendimiento, sino que también le da a Genie Ontology un contexto más sólido para extraer y clasificar en todo el patrimonio de datos. Haga lo mismo con sus otros activos: documente los notebooks con celdas de Markdown, las consultas SQL guardadas con comentarios y los paneles de AI/BI con descripciones y anotaciones. Juntos, estos elementos proporcionan el conocimiento empresarial detallado y de cola larga (long-tail) en el que se basa Genie Ontology.
- Certificar los activos en los que confía. La certificación marca sus activos de datos e IA, como Metric Views, agentes de Genie o notebooks, como validados y aprobados, y sirve como una señal sólida para determinar qué fuentes son autoritativas. Los activos certificados y ampliamente utilizados tienen más autoridad que los no verificados, por lo que certificar sus activos de confianza influye directamente en qué contexto prevalece en caso de conflicto. Marcar como obsoletos los activos desactualizados es la otra mitad de esto: aleja tanto a las personas como a los agentes del contenido que ya no respalda.
- Clasificar los datos sensibles y monitorear la calidad. La clasificación de datos identifica y etiqueta los datos sensibles para que puedan gobernarse de manera coherente, y el monitoreo de la calidad de los datos detecta desviaciones (drift) y anomalías antes de que afecten a las personas y agentes que dependen de ellos. Ambos procesos ayudan a garantizar que los activos que alimentan la ontología sean confiables.

Capa 4: Construir la capa de gobernanza
La gobernanza es lo que hace que las respuestas de Genie sean seguras y confiables. Dado que los permisos determinan qué contexto puede recuperar Genie Ontology, dos personas pueden hacer la misma pregunta y recibir respuestas diferentes según lo que cada una esté autorizada a ver.
Veamos la gobernanza en tres áreas específicas:
- Comenzar con los controles de acceso de Unity Catalog. El modelo de privilegios de Unity Catalog es la base. Controla el acceso a catálogos, esquemas, tablas y otros activos del espacio de trabajo, y Genie Ontology respeta esos permisos. Genie solo utiliza contenido que la persona que pregunta está autorizada a ver, por lo que preguntas idénticas pueden producir respuestas diferentes según el usuario. Administrar el acceso a través de grupos en lugar de individuos facilita el mantenimiento de los permisos a medida que escala.
- Agregar controles detallados donde los datos lo requieran. Para los datos sensibles, la seguridad a nivel de fila restringe qué filas puede ver un usuario, y el enmascaramiento de columnas oculta los valores sensibles. Ambos se aplican en el momento de la consulta. El control de acceso basado en atributos le permite gestionar estas protecciones a partir de etiquetas gobernadas, de modo que una política vinculada a una etiqueta de sensibilidad se aplica en todos los lugares donde aparece esa etiqueta, en lugar de definirse tabla por tabla. Esto proporciona una forma escalable de aplicar la protección a nivel de fila y columna de manera constante en todo un gran patrimonio de datos.
- Gobernar la capa de IA. Unity AI Gateway proporciona a los administradores un lugar centralizado para gestionar el acceso a los modelos, los límites de velocidad, el registro de carga útil (payload logging) y los controles de costos para las cargas de trabajo de IA, así como controles de seguridad y de datos sensibles sobre lo que se envía a los modelos. Es el punto de control para gobernar el comportamiento del agente y sus gastos a medida que crece el uso.
En conjunto, estos controles determinan qué contexto puede recuperar la ontología y qué usuarios pueden recibirlo. El contenido no autorizado no participa en la recuperación, por lo que no puede influir en una respuesta de forma indirecta.

Capa 5: Evaluar y mejorar
Las primeras cinco capas construyen el contexto de negocio que Genie utiliza para responder preguntas. La capa de evaluar y mejorar mantiene la precisión de ese contexto a medida que el negocio cambia. Las métricas se redefinen, las tablas quedan obsoletas y se introducen nuevos productos. Medir regularmente la calidad de las respuestas ayuda a identificar cuándo debe adaptarse la ontología, antes de que las respuestas obsoletas o incorrectas erosionen la confianza del usuario.
Hay cuatro áreas clave a considerar:
- Validar la experiencia antes del lanzamiento. Comience con un conjunto representativo de preguntas de negocio para cada dominio prioritario. Defina la respuesta esperada, la fuente autoritativa y los criterios de aceptación para cada pregunta. Luego, pruebe esas preguntas en Genie One, asegurándose de que utilicen las Metric Views, las páginas, los agentes de Genie, los paneles, las consultas y otras fuentes de las que dependerán los usuarios. Los Genie Agent Benchmarks proporcionan una forma integrada de evaluar un agente de Genie individual a lo largo del tiempo. En el modo Chat, las evaluaciones comparativas (benchmarks) pueden comparar los resultados con respuestas SQL validadas; en el modo Agente, las respuestas se evalúan utilizando un juez de LLM y criterios de evaluación opcionales. Para Genie One y, de manera más amplia, Genie Ontology, su equipo debe definir y ser propietario del conjunto de preguntas, la verdad fundamental (ground truth), la validación de fuentes, el proceso de revisión manual y los umbrales de aceptación. Cuando una respuesta falle, rastréela hasta la fuente o el contexto subyacente y solucione la causa raíz. Eso podría significar definir una lógica de métricas gobernada en una Metric View, aclarar una definición de negocio en una página, mejorar los metadatos de Unity Catalog, certificar o marcar como obsoleto un activo, o refinar la curación de un agente de Genie específico del dominio.
- Supervise las respuestas, el uso y la calidad de las fuentes. Utilice la capacidad de monitoreo de los activos aprovechados por Genie Ontology. Genie Agent Monitor proporciona visibilidad sobre las preguntas, respuestas, comentarios, respuestas marcadas y tendencias de uso de cada Agent individual. En Genie One, las citas de fuentes ayudan a los usuarios y administradores a inspeccionar qué fuentes de la Ontology contribuyeron a una respuesta. El Query History, los registros de auditoría y las tablas del sistema de facturación pueden proporcionar visibilidad adicional sobre la ejecución de SQL, los eventos y el uso.
- Cierre el ciclo de retroalimentación en la capa adecuada. Capture los comentarios de los usuarios y las solicitudes de revisión, y luego dirija el problema al activo responsable de la respuesta. La corrección debe realizarse donde corresponda el significado comercial:
- Una Page, cuando el problema es una definición comercial o un sinónimo.
- Una Metric View, cuando el problema es una medida gobernada, dimensión, relación o cálculo.
- Metadatos, permisos, certificación o depreciación de Unity Catalog, cuando el problema está en un activo de origen.
- Las instrucciones de un Genie Agent, ejemplos de SQL, expresiones SQL, respuestas de confianza o el Knowledge Store, cuando el problema es específico del dominio de ese Agent. Los Genie Agents tienen varias capacidades integradas para capturar los comentarios de los usuarios y actuar en consecuencia, lo que incluye votar a favor o en contra, solicitar revisión, inspeccionar el SQL generado, agregar como instrucción y agregar como benchmark.
- Esté atento a la desviación (drift) en sus activos. La desviación puede ocurrir en muchos lugares: definiciones comerciales, lógica de KPI, metadatos de tablas, joins, dashboards, notebooks, pipelines, instrucciones de Genie Agent y patrones de uso de fuentes. Establezca propietarios y una frecuencia de revisión para los activos de cada dominio crítico. Al abordar la desviación, aproveche el modelo que ya ha creado: Pages para conceptos autorizados, Metric Views para dimensiones y medidas gobernadas, Domains para la organización y administración, y certificación o depreciación para marcar lo que se recomienda o está obsoleto. Mantenga actualizados las tablas de origen, las vistas, los dashboards, los notebooks y las consultas, ya que todos ellos alimentan el contexto inferido, y utilice permisos para mantener el contenido experimental o retirado alejado de personas y agentes que no deberían verlo. En el caso de los Genie Agents, vuelva a ejecutar sus conjuntos de benchmarks después de realizar cambios sustanciales en sus datos, instrucciones, ejemplos o activos de confianza.

La evaluación no es una puerta de control única antes del lanzamiento; es un hábito continuo en cada activo que alimenta una respuesta. Databricks le ofrece los activos semánticos gobernados, la recuperación y citas de ontología, la evaluación y el monitoreo a nivel de Agent, y la telemetría de tablas del sistema. Usted aporta la verdad fundamental (ground truth), la propiedad, el proceso de revisión y el mantenimiento recurrente que mantiene la confiabilidad de Genie.
Comience con un dominio y luego expándase
Una conclusión clave es que no es necesario construir las seis capas a la vez. No debería intentar abarcar todo el negocio antes de la puesta en marcha. El camino práctico es simplemente comenzar a usar Genie, luego elegir un dominio de alto valor y fortalecer deliberadamente las definiciones, las fuentes, la gobernanza y la evaluación que más importan. Este es un enfoque de "expandirse a medida que se aprende" en lugar de intentar abarcar demasiado de golpe.
Elija ese primer dominio de manera deliberada. Comience con un flujo de trabajo recurrente y de alta fricción en el que los equipos ya dediquen tiempo a conciliar números a mano, como una llamada de pronóstico o un ciclo de planificación. Estos son los lugares donde una respuesta confiable tiene el mayor valor y donde usted ya sabe cómo se ve el resultado "correcto". En la práctica, comience con algo acotado: elija un dominio como Ventas y una métrica como ARR, y luego consolide la base. Certifique la métrica crítica, defina los términos importantes, identifique los activos autorizados, gobierne el acceso y evalúe las preguntas clave. Utilice los resultados para guiar el siguiente dominio.
Ese último punto importa más de lo que parece. El objetivo de estas prácticas no es la integridad técnica por sí misma; es la confianza: si un usuario de negocio cree en una respuesta lo suficiente como para actuar en consecuencia. Cada capa gana un poco de esa confianza, y el ciclo de evaluación hace que esa confianza sea visible y defendible, en lugar de ser una cuestión de opinión.
Dos cosas se potencian a medida que avanza. Cada entidad resuelta, activo documentado, métrica certificada, definición de página de glosario y conjunto de datos gobernado fortalece el núcleo autorizado. Y cada interacción puede revelar comentarios que los equipos utilizan para mejorarlo. El resultado es un entendimiento comercial compartido que mejora con el uso en lugar de deteriorarse.
La puesta en marcha de Genie Ontology no es un megaproyecto de modelado. Es una inversión constante y por capas en su modelo de datos, metadatos, semántica empresarial, contexto corporativo, gobernanza y evaluación, entregada un dominio a la vez, que le brinda a la AI una comprensión real de su negocio.
Más información
Si desea obtener más información, lea el blog de anuncio de Genie Ontology y visite las páginas web de Genie One y Genie Agents. Además, consulte la página web de Unity Catalog Semantics para profundizar en las Metric Views. Solo estamos empezando a ver lo que es posible cuando la AI puede basarse en un entendimiento compartido y confiable del negocio. Estamos ansiosos por ver cómo los clientes utilizan Genie Ontology para tomar decisiones más rápidas, actuar con mayor confianza y crear nuevas formas de trabajar.
(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original