El lakehouse interno de Databricks alberga más de 100 000 tablas que abarcan ingeniería, go-to-market, recursos humanos, finanzas y telemetría de productos. Antes de Unity Catalog, la gobernanza era inconsistente: los patrones de acceso variaban según el equipo, las clasificaciones estaban incompletas y nadie podía decir con seguridad qué conjuntos de datos eran seguros para el entrenamiento de IA. El equipo de la Plataforma de Datos reconstruyó la gobernanza desde los primeros principios. Hacen que la gobernanza en Databricks sea automática, medible y esté lista para la era de la IA agéntica. Así es como lo hicieron.
Cuando nadie puede responder: "¿están gobernados estos datos?"
Databricks estaba escalando rápidamente y sus datos lo hacían aún más rápido. Más de 100 000 tablas estaban distribuidas en docenas de equipos, espacios de trabajo y catálogos. Cada equipo gestionaba el acceso de manera diferente. Las clasificaciones eran inconsistentes o faltaban por completo.
La fricción no era teórica. Los equipos de seguridad, legal e ingeniería pasaban horas buscando en hojas de cálculo para responder preguntas básicas durante las revisiones de cumplimiento. Los nuevos proyectos de IA se estancaban porque nadie podía confirmar si un conjunto de datos cumplía con los requisitos de privacidad. Cuando un equipo quería entrenar un modelo, no había una forma sistemática de verificar si los datos de entrenamiento estaban clasificados, gobernados o incluso actualizados.
“Todos tenían acceso de lectura y escritura a cada tabla, a cada trabajo”, dice Bruce Wong, director sénior de Ingeniería y responsable de la Plataforma de Datos en Databricks. “No es solo que no hubiera una única fuente de verdad. Había muchas fuentes y ninguna verdad”. Wong describe lo que el equipo heredó como un “pantano de datos” (data swamp): aislado, sin gobernanza e incapaz de escalar.
El desafío no era la falta de buenas intenciones. Los equipos se preocupaban por la calidad de los datos. Pero el modelo de gobernanza que funcionaba con 10 personas y un gigabyte no funciona con 10 000 personas y un exabyte. Sin un sistema unificado, la gobernanza era un mosaico de procesos manuales que no podía mantener el ritmo.
Mientras tanto, el equipo de la plataforma de datos renovó por completo el patrimonio de datos, desde la ingesta de datos SaaS a través de Lakeflow Connect, hasta la portabilidad multinube y la analítica federada en todos los dominios comerciales. Para mantener el ritmo del crecimiento de la empresa, cada línea de negocio necesitaba datos confiables y gobernados para operar. El equipo de la plataforma necesitaba una solución que funcionara no solo para los ingenieros que crean canalizaciones, sino para cada analista, especialista en marketing, líder de finanzas y operador de ventas de toda la empresa. Li Yang, gerente sénior de Ingeniería en Databricks, conocía este desafío de cerca, tras haber pasado una década en otras empresas tecnológicas lidiando con problemas de escalabilidad similares. “En un mundo B2B, la confianza no es una característica. La confianza es el producto”, dice Yang. “Necesitábamos alejarnos de un modelo que se sentía como intentar reparar un avión en pleno vuelo”.
Clasificación, controles de acceso y una puntuación para cada conjunto de datos
El equipo comenzó como cliente alfa de Unity Catalog con un principio rector: cada conjunto de datos debe ser confiable, gobernado y estar listo para la IA de forma predeterminada, a través de límites de seguridad (guardrails), no de barreras. Unity Catalog les permitió tomar decisiones de políticas y gobernanza a nivel de catálogo en lugar de gestionar usuarios y tablas individuales, un cambio de paradigma que transformó fundamentalmente su enfoque del lakehouse.
En primer lugar, crearon un modelo de clasificación universal dentro de Unity Catalog. Cada tabla se etiqueta según la sensibilidad de los datos (pública, interna, confidencial, restringida, altamente restringida) y por dominio (ingeniería, GTM, recursos humanos, finanzas, etc.). Estas etiquetas se asignan a zonas de gobernanza que determinan la aplicación del acceso. En segundo lugar, automatizaron los controles de acceso. Una plataforma interna llamada Fortress, construida sobre las API de seguridad de Unity Catalog, aplica un acceso limitado en el tiempo y vinculado a un propósito. Se acabaron los derechos permanentes. Cada solicitud indica un motivo, expira según lo programado y es completamente auditable.
Para medir la confianza a escala, el equipo creó el Data Governance Score (puntuación de gobernanza de datos), que proporciona una métrica continua de 0 a 100 para cada conjunto de datos. La puntuación evalúa tres pilares: documentación (¿están descritas las columnas y anotadas las tablas?), confiabilidad (¿se superan las comprobaciones de calidad de los datos?) y gobernanza (¿están los datos clasificados y con control de acceso?). El Data Governance Score se propaga de manera descendente a través del linaje: si una tabla ascendente pierde la confianza, cada tabla que depende de ella refleja ese cambio automáticamente. Amit Pahwa, ingeniero de software de plantilla (Staff Software Engineer) en el equipo de la Plataforma de Datos de Databricks, ayudó a diseñar el Data Governance Score para que la empresa dejara de depender del conocimiento informal de los equipos. Destaca que, sin datos estructurados, “la confianza es la diferencia entre guiarse por los hechos o por la intuición”.
Más allá de la capa central de gobernanza, otros flujos de trabajo de la plataforma de datos amplían su alcance. Lakeflow Connect gestiona la ingesta segura de SaaS a escala, lo que reemplazó los conectores frágiles por canalizaciones gobernadas que depositan los datos directamente en la arquitectura medallion. Una plataforma multinube garantiza que las cargas de trabajo sean portátiles y seguras en AWS, Azure y GCP. Una capa de analítica federada brinda a cada dominio comercial, desde finanzas hasta marketing y operaciones de ventas, acceso de autoservicio a datos gobernados a través de herramientas como AI/BI Genie y Databricks Apps. Un almacén de métricas dedicado, construido sobre Unity Catalog Metric Views, garantiza que los equipos de toda la empresa compartan una única definición para cada métrica clave. La implementación de Fortress supuso un cambio cultural para la empresa. "Antes de Fortress, solicitar acceso a los datos se sentía como una caja negra para los usuarios", dice Yang. "Ahora, es un proceso transparente y de autoservicio donde las políticas se aplican automáticamente, lo que libera a los ingenieros para que se concentren en la innovación en lugar de aprobar solicitudes manualmente".
La IA agéntica exige la gobernanza que ya construyeron
El Data Governance Score le dio al equipo de la Plataforma de Datos algo que nunca antes había tenido: visibilidad en tiempo real de qué dominios cumplían con las normativas y cuáles necesitaban atención. Cada una de las más de 100 000 tablas se analiza ahora de forma continua y se le asigna una calificación de confianza de 0 a 100. En lugar de que las revisiones de cumplimiento desencadenen situaciones de emergencia de última hora, el equipo detecta los puntos débiles en tiempo real y los aborda de forma proactiva. Los equipos de seguridad y legal dedican su tiempo a prevenir riesgos en lugar de buscar en hojas de cálculo.
El impacto más amplio va más allá del cumplimiento. Los datos confiables aceleran cada flujo de trabajo descendente. Cuando un equipo quiere entrenar un modelo, verifica la puntuación de gobernanza y sabe de inmediato si los datos cumplen con los requisitos, sin revisiones manuales ni esperas de aprobación. El almacén de métricas garantiza que cuando el equipo de liderazgo hace una pregunta sobre la canalización, los ingresos o el uso, la respuesta sea la misma independientemente de quién ejecute la consulta o qué herramienta utilice.
Pero la transformación que más importa es la que el equipo no planeó. Wong lo expresa sin rodeos: “La gobernanza de datos es un requisito básico para la IA agéntica”. Un ser humano nunca examinará 100 000 tablas. Un agente de IA encontrará los datos obsoletos, la tabla con exceso de permisos o el conjunto de datos no clasificado con el que un humano nunca se toparía. “En este punto, es más probable que la IA encuentre datos incorrectos y te dé una respuesta basada en ellos a que realmente alucine”, advierte Wong. La infraestructura de gobernanza que el equipo pasó años construyendo, desde el modelo de clasificación hasta el Data Governance Score y la propagación de confianza basada en el linaje, ahora sirve como la capa de límites de seguridad (guardrails) para los agentes en toda la empresa.
Hoy en día, cada función en Databricks (ingeniería, finanzas, marketing, ventas e incluso instalaciones) utiliza agentes creados sobre esta base gobernada. La cantidad de datos generados por la IA agéntica está creciendo a un ritmo que Wong espera que eclipse al de los datos generados por humanos. Debido a que las estructuras de gobernanza se diseñaron para humanos a escala, se traducen directamente a agentes a escala. El equipo que reconstruyó la gobernanza desde los primeros principios es ahora el equipo que hace posible el futuro de la IA de la empresa.


