Cómo el streaming de datos de tecnología operativa en Databricks permite que los agentes de AI compuestos razonen, optimicen y asesoren, en lugar de solo monitorear.
09:14, mitad del turno. La llenadora se detiene. El gerente de línea tiene minutos, no horas, antes de que los equipos de flujo abajo se queden sin material. El equipo de trabajo ya sabe qué hacer a nivel mecánico. Las preguntas que toman más tiempo son las de planificación. ¿Aún podemos alcanzar el objetivo del turno? ¿Es más barato aumentar la velocidad después o programar horas extras? ¿Ha ocurrido la misma falla en esta línea antes y cómo se recuperó el turno anterior?
Los datos para responder a estas tres preguntas ya existen, dispersos en PLCs, SCADA, MES, ERP y LIMS.
ProdLine CoPilot está diseñado para esa ventana de tiempo. Lee el estado en tiempo real desde la plataforma de inteligencia de datos de Databricks, dirige la pregunta a un especialista de dominio y ejecuta los cálculos matemáticos subyacentes (recuperación de programación, agotamiento, riesgo de calidad). El plan se entrega probado frente a 1,000 escenarios de programación, equilibrando las compensaciones entre costo, horas extras y servicio. El gerente de línea elige. El sistema redacta los borradores de los artefactos (orden de trabajo, retención, nota de programación) para su aprobación.
Una línea típica de empaque de CPG (embotellado, enlatado, snacks, cosméticos) tiene entre 15 y 20 máquinas. Cuando una llenadora o etiquetadora se detiene, los acumuladores solo cubren unos pocos minutos antes de que la línea se quede sin material y la producción caiga muy por debajo de la capacidad nominal. El OEE de clase mundial ronda el 85%; muchas plantas están más cerca de un rango de entre el 70% y el 75%. A 500 cajas por hora en un esquema de 24/5 con una contribución de 10 € por caja, un punto de OEE equivale aproximadamente a 300,000 € al año. Reduzca una brecha de 10 puntos en una sola línea y estará en el rango de los millones; en una planta con una docena de líneas, eso se acumula rápidamente.
Los datos para cerrar esa brecha ya existen:
Estos sistemas no se comunican entre sí. Las personas que necesitan respuestas (gerentes de línea, líderes de turno, planificadores) a menudo no escriben SQL.
El patrón es familiar: primero los informes de fin de turno, luego la consulta del analista a la mañana siguiente y, finalmente, una reunión de RCA 24 horas después del evento. Todo esto mientras la decisión de recuperación (velocidad, horas extras, CIP) ya se había tomado durante el turno.
Transmitir OT en tiempo real a Databricks no es solo una actualización de tablero. Unir OT con MES, ERP y LIMS en un solo lakehouse gobernado es lo que permite a los agentes razonar sobre el estado en tiempo real, optimizar bajo restricciones reales y hacer recomendaciones durante el turno en lugar de después del evento.
El patrón anterior consistía en configurar una infraestructura de tipo Kafka (brokers, particiones, grupos de consumidores) solo para mover los datos de la planta. Zerobus Ingest reemplaza eso. Se basa en push y es serverless. Cualquier elemento que pueda realizar llamadas gRPC o REST (puerta de enlace PLC, conector de historiador, dispositivo perimetral) registra filas en las tablas Delta de Unity Catalog.
Sin brokers ni particiones; usted escala abriendo más conexiones. Combínelo con Lakeflow Spark Declarative Pipelines y la arquitectura de medallas estándar Bronze, Silver y Gold para telemetría, señales de calidad, eventos e inventario.
El MES, ERP y LIMS llegan con una frecuencia más lenta que la OT de subsegundos (espejo, lote o CDC), pero se ubican junto a las tablas de OT bajo un único catálogo gobernado en lugar de en un almacén de datos separado.
Una vez que los datos están ingresados, las mismas tablas alimentan SQL, Genie, AI Search, Model Serving y los agentes, con un linaje compartido bajo Unity Catalog. Las señales predictivas, la recuperación de programación y la analítica de flujo abajo leen de estas tablas gobernadas, por lo que cada nueva capacidad escribe sobre la copia existente en lugar de aprovisionar una propia.
Zerobus + Delta maneja la ingesta casi en tiempo real con una latencia de un solo dígito de segundos, gobernada bajo Unity Catalog. Para la UI en vivo en esta demostración, el productor también escribe directamente en Lakebase: un atajo para obtener la sensación de tiempo real hoy, no el patrón a largo plazo. La lectura en milisegundos de esas mismas tablas Delta es lo que manejará Lakehouse//RT, el almacén de datos en tiempo real de Databricks en el lakehouse.
Muchas plantas ejecutan los informes en un lugar y los modelos en otro, por lo que la propia línea termina con más de una versión de la verdad a través de los sistemas. Esa división rompe los copilotos en tiempo de turno:
El lakehouse en Databricks cierra esa división en cada uno de esos tres puntos. Hay una sola copia de los datos (Delta abierto en almacenamiento en la nube, no una extracción separada por carga de trabajo). La gobernanza reside en esa copia en Unity Catalog, por lo que los permisos del analista y los del agente provienen de la misma fuente. Y la transmisión, SQL, la IA y el servicio se ejecutan sobre una misma base, por lo que el informe matutino y la pantalla en vivo muestran el mismo número.
Los especialistas y optimizadores leen las mismas tablas gobernadas que mantienen sus pipelines. No existe una base de datos de IA separada.
El orquestador es la puerta de entrada. Acepta una pregunta en lenguaje natural, carga el estado actual desde Unity Catalog (máquinas, eventos, programación, inventario, calidad, restricciones) y dirige la intención al especialista adecuado.
Cada llamada lee el estado más reciente de UC antes de que se inicie el LLM. El sistema recomienda y redacta borradores de artefactos (tickets, aprobaciones, notas de turno). La ejecución sigue a cargo del gerente de línea, calidad y mantenimiento.
La memoria de conversación corta reside en Lakebase, y el corpus de incidentes pasados en AI Search. Model Serving sirve los modelos y MLflow rastrea cada llamada.
Un solo agente genérico simplifica demasiado o pierde el enfoque. El RCA de tiempo de inactividad, el inventario y los cálculos de programación necesitan datos y matemáticas diferentes. Un equipo de especialistas mantiene cada prompt acotado y cada herramienta orientada a la pregunta.
Por ejemplo, el Analista de Tiempos de Inactividad no consume contexto en tablas de inventario, y el Optimizador de Programación no extrae filas de control de calidad sin procesar de la forma en que lo hace el Especialista de Calidad.
| Especialista | Qué hace |
|---|---|
| Downtime Analyst | Causa raíz, efecto cascada entre máquinas, prioridad de recuperación; eventos + sensores |
| Quality Specialist | SPC en llenado, torque, etiquetas, peso de la caja; retención/liberación; riesgo bayesiano |
| Supply Chain Advisor | Decenas de insumos de línea (por ejemplo, etiquetas, película, cierres, adhesivos, productos químicos de proceso): tasas de consumo, agotamiento, urgencia de reorden |
| OEE Coach | Pérdidas de disponibilidad / rendimiento / calidad; Pareto; Genie para tendencias |
| Schedule Optimizer | Planes de recuperación estocásticos / MILP; compensaciones: costo, riesgo de programación/servicio, rendimiento |
| Maintenance Predictor | Anomalías (Z-score, IQR); señales tipo RUL; compensaciones de PM |
| Strategic Advisor | Tendencias de múltiples turnos; hoja de ruta de mejora; marco CAPEX/OPEX; benchmarking |
| Shift Briefing | Lecturas de reunión previa al turno / entrega posterior al turno; optimizado para Genie, resumen enfocado en dispositivos móviles |
Los especialistas llaman a un conjunto pequeño y fijo de herramientas. SQL Query y Genie Space extraen lecturas gobernadas, de la misma manera que lo hace el resto de la organización. La Calculadora ejecuta cálculos matemáticos de OEE, recuperación y agotamiento en Python (NumPy y Pandas) sobre la telemetría de Databricks SQL. Un Detector de Anomalías ejecuta Z-score e rango intercuartílico (IQR) sobre ventanas móviles directamente en esas tablas. Plan & Constraints contiene los límites de velocidad por línea, las ventanas de CIP, las reglas de cambio de formato y la política de horas extras. Similar Cases recupera incidentes históricos de Databricks AI Search.
Muchos copilotos de manufactura son simples capas superficiales sobre LLM. ProdLine dirige las consultas a solucionadores reales (del tipo que utilizan los equipos de investigación de operaciones) a través de lenguaje natural.
| Optimizador | Método | Qué resuelve |
|---|---|---|
| Schedule Recovery | MILP (OR-Tools SCIP) | Velocidad, OT, CIP: óptimo bajo el modelo establecido, no una heurística vaga |
| Stochastic Schedule | SAA + escenarios | Plan robusto a través de la variabilidad de OEE / microparadas |
| Production Forecast | Monte Carlo (por ejemplo, 1,000 trayectorias) | Franjas de finalización P10/P50/P90 a partir del historial |
| Quality Risk | Bayesian CPT | Puntaje de riesgo + factores determinantes |
| OEE Loss Analysis | Pareto | Clasificar las pérdidas por magnitud / ROI |
| Multi-Shift Planner | Optimización secuencial | Velocidad entre turnos, OT, CIP, PM |
| RUL Estimator | Extrapolación de tendencias | Compensación en la programación de PM |
Nada se ejecuta sin la aprobación de un humano. El gerente de línea es responsable de la recuperación, el equipo de calidad se encarga de la retención y liberación, y el de mantenimiento de la orden de trabajo. El objetivo es reducir la carga cognitiva de saltar entre hojas de cálculo, radios y paneles de control, no eliminar al gerente de producción.
Debe responder a tres preguntas en menos de un minuto: qué está pasando, cuáles son las opciones realistas y cuánto cuesta cada opción en términos de rendimiento, horas extra, calidad y servicio.
Puertas de aprobación (por diseño):
| Rol | Aprueba |
|---|---|
| Gerente de línea | Recuperación: velocidad, horas extra, programación |
| Calidad | Retención/liberación, desviaciones |
| Mantenimiento | Alcance del trabajo y tiempos |
La demo actual cubre el bucle de razonamiento y recomendación. El siguiente paso es cerrar el bucle con escrituras directas en el sistema (write-backs), todas diseñadas como borradores en lugar de control automático.
La transferencia al CMMS es un borrador de orden de trabajo (fallo diagnosticado, alcance recomendado, tiempo objetivo, piezas necesarias) para que el planificador la programe. Para calidad, el QMS y el LIMS reciben un registro de desviación precargado (lote, máquina, ID de muestras, gravedad, disposición recomendada) que el responsable de calidad revisa y resuelve. El MES y el sistema de planificación y programación avanzada (APS) reciben una actualización de programación preliminar con ajustes de velocidad, horas extra, cambios de secuencia y la justificación de la recuperación, registrada para la ejecución del turno.
La trazabilidad sigue la misma hoja de ruta: cada recomendación almacena sus entradas, suposiciones, restricciones, aprobador y resultado de extremo a extremo, lo que facilita el relevo de turnos y la mejora continua.
La parte más difícil de la implementación en múltiples plantas son los datos, no la IA. Cada planta tiene sus propias máquinas, SOPs y esquemas de LIMS. Lo que hace que la segunda planta sea un aporte incremental en lugar de un proyecto paralelo es la capa de streaming subyacente: cada planta se basa en el mismo patrón de Zerobus, diseño de medallón (medallion layout) y gobernanza de Unity Catalog, con sus propias tablas y Genie Space bajo un espacio de nombres dedicado.
Los optimizadores se mantienen parametrizados. Una tabla line_constraints define los límites de velocidad, límites de horas extra, ventanas de CIP y transiciones, de modo que cambiar los datos cambia el comportamiento, sin necesidad de volver a implementar.
La misma base financia el siguiente caso de uso. Energía y sostenibilidad leen la misma telemetría, la calidad del proveedor se basa en la unión (join) de LIMS y la seguridad se basa en el flujo de eventos. Cada nuevo proyecto se implementa sobre la infraestructura que el primero ya pagó, en lugar de levantar una plataforma paralela.
Clona el repositorio de código y ejecuta databricks bundle deploy en tu propio espacio de trabajo. Para usar los datos de tu propia planta, apunta el productor a tu historiador en lugar de al simulador; Zerobus, el diseño de medallón (medallion layout), las herramientas de agente y los borradores con intervención humana (human-in-the-loop) se mantienen igual. Abre prodline_copilot_film.html en un navegador para ver una demostración animada de dos minutos antes de clonar.
¿Te interesa crear tu propio asistente de monitoreo de línea y te gustaría saber más? Ponte en contacto con tu representante de cuenta de Databricks. Un especialista de Databricks también puede ayudarte a definir el alcance para integrar OT, MES, ERP y LIMS en un solo lakehouse gobernado.
Acrónimos utilizados en esta publicación, en orden alfabético.
(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original
Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.