Ir al contenido principal
Fabricación

Agentes para líneas de producción: decisiones confiables en tiempo real

Cómo el streaming de datos de tecnología operativa en Databricks permite que los agentes de AI compuestos razonen, optimicen y asesoren, en lugar de solo monitorear.

por Mohammad Khelghati

  • Minutos, no horas. Cuando una línea de envasado se detiene, cada minuto cuenta. Una caída de 10 puntos en el OEE le cuesta a una empresa típica de CPG decenas de millones de euros al año. Eso no es ni siquiera una hora por turno. No hay mucho margen para pensar; el gerente de línea tiene que tomar la decisión de recuperación antes de que los equipos de flujo descendente se queden sin suministro. ProdLine CoPilot lee el estado en tiempo real desde Databricks Data Intelligence Platform y ofrece una respuesta dentro del mismo turno, en lugar de a la mañana siguiente.
  • Núcleo de datos unificado. Zerobus transmite telemetría OT en tiempo real a tablas Delta; MES, ERP y LIMS se integran bajo Unity Catalog. Los especialistas de dominio leen el estado de la planta en tiempo real y recurren a solucionadores reales (Monte Carlo, MILP, bayesiano, Pareto) bajo las mismas restricciones que ya utilizan los planificadores.
  • El equipo mantiene el control. Las recomendaciones se presentan como borradores de órdenes de trabajo, retenciones y notas de programación. El gerente de línea, el responsable de calidad y el encargado de mantenimiento aprueban. Cada decisión es rastreable de extremo a extremo.

Resumen ejecutivo

09:14, mitad del turno. La llenadora se detiene. El gerente de línea tiene minutos, no horas, antes de que los equipos de flujo abajo se queden sin material. El equipo de trabajo ya sabe qué hacer a nivel mecánico. Las preguntas que toman más tiempo son las de planificación. ¿Aún podemos alcanzar el objetivo del turno? ¿Es más barato aumentar la velocidad después o programar horas extras? ¿Ha ocurrido la misma falla en esta línea antes y cómo se recuperó el turno anterior?

Los datos para responder a estas tres preguntas ya existen, dispersos en PLCs, SCADA, MES, ERP y LIMS.

ProdLine CoPilot está diseñado para esa ventana de tiempo. Lee el estado en tiempo real desde la plataforma de inteligencia de datos de Databricks, dirige la pregunta a un especialista de dominio y ejecuta los cálculos matemáticos subyacentes (recuperación de programación, agotamiento, riesgo de calidad). El plan se entrega probado frente a 1,000 escenarios de programación, equilibrando las compensaciones entre costo, horas extras y servicio. El gerente de línea elige. El sistema redacta los borradores de los artefactos (orden de trabajo, retención, nota de programación) para su aprobación.

El verdadero problema: ricos en datos, pobres en información

Una línea típica de empaque de CPG (embotellado, enlatado, snacks, cosméticos) tiene entre 15 y 20 máquinas. Cuando una llenadora o etiquetadora se detiene, los acumuladores solo cubren unos pocos minutos antes de que la línea se quede sin material y la producción caiga muy por debajo de la capacidad nominal. El OEE de clase mundial ronda el 85%; muchas plantas están más cerca de un rango de entre el 70% y el 75%. A 500 cajas por hora en un esquema de 24/5 con una contribución de 10 € por caja, un punto de OEE equivale aproximadamente a 300,000 € al año. Reduzca una brecha de 10 puntos en una sola línea y estará en el rango de los millones; en una planta con una docena de líneas, eso se acumula rápidamente.

Los datos para cerrar esa brecha ya existen:

  • Los PLCs y SCADA transmiten telemetría en subsegundos.
  • El MES registra cada microparada, parada mayor, retención y cambio de formato.
  • El ERP gestiona el inventario y las programaciones.
  • El LIMS contiene los resultados de calidad.

Estos sistemas no se comunican entre sí. Las personas que necesitan respuestas (gerentes de línea, líderes de turno, planificadores) a menudo no escriben SQL.

El patrón es familiar: primero los informes de fin de turno, luego la consulta del analista a la mañana siguiente y, finalmente, una reunión de RCA 24 horas después del evento. Todo esto mientras la decisión de recuperación (velocidad, horas extras, CIP) ya se había tomado durante el turno.

Transmitir OT en tiempo real a Databricks no es solo una actualización de tablero. Unir OT con MES, ERP y LIMS en un solo lakehouse gobernado es lo que permite a los agentes razonar sobre el estado en tiempo real, optimizar bajo restricciones reales y hacer recomendaciones durante el turno en lugar de después del evento.

Transmisión en tiempo real: del informe matutino a la señal durante el turno

El patrón anterior consistía en configurar una infraestructura de tipo Kafka (brokers, particiones, grupos de consumidores) solo para mover los datos de la planta. Zerobus Ingest reemplaza eso. Se basa en push y es serverless. Cualquier elemento que pueda realizar llamadas gRPC o REST (puerta de enlace PLC, conector de historiador, dispositivo perimetral) registra filas en las tablas Delta de Unity Catalog.

Sin brokers ni particiones; usted escala abriendo más conexiones. Combínelo con Lakeflow Spark Declarative Pipelines y la arquitectura de medallas estándar Bronze, Silver y Gold para telemetría, señales de calidad, eventos e inventario.

El MES, ERP y LIMS llegan con una frecuencia más lenta que la OT de subsegundos (espejo, lote o CDC), pero se ubican junto a las tablas de OT bajo un único catálogo gobernado en lugar de en un almacén de datos separado.

Una vez que los datos están ingresados, las mismas tablas alimentan SQL, Genie, AI Search, Model Serving y los agentes, con un linaje compartido bajo Unity Catalog. Las señales predictivas, la recuperación de programación y la analítica de flujo abajo leen de estas tablas gobernadas, por lo que cada nueva capacidad escribe sobre la copia existente en lugar de aprovisionar una propia.

Zerobus + Delta maneja la ingesta casi en tiempo real con una latencia de un solo dígito de segundos, gobernada bajo Unity Catalog. Para la UI en vivo en esta demostración, el productor también escribe directamente en Lakebase: un atajo para obtener la sensación de tiempo real hoy, no el patrón a largo plazo. La lectura en milisegundos de esas mismas tablas Delta es lo que manejará Lakehouse//RT, el almacén de datos en tiempo real de Databricks en el lakehouse.

Por qué Databricks

Muchas plantas ejecutan los informes en un lugar y los modelos en otro, por lo que la propia línea termina con más de una versión de la verdad a través de los sistemas. Esa división rompe los copilotos en tiempo de turno:

  • La latencia se acumula en cada transferencia entre sistemas.
  • Los equipos pagan un costo de reconciliación para alinear las extracciones.
  • Los permisos divergen entre las fuentes de datos.

El lakehouse en Databricks cierra esa división en cada uno de esos tres puntos. Hay una sola copia de los datos (Delta abierto en almacenamiento en la nube, no una extracción separada por carga de trabajo). La gobernanza reside en esa copia en Unity Catalog, por lo que los permisos del analista y los del agente provienen de la misma fuente. Y la transmisión, SQL, la IA y el servicio se ejecutan sobre una misma base, por lo que el informe matutino y la pantalla en vivo muestran el mismo número.

Los especialistas y optimizadores leen las mismas tablas gobernadas que mantienen sus pipelines. No existe una base de datos de IA separada.

Anatomía de un sistema de agentes para líneas de producción

El orquestador

El orquestador es la puerta de entrada. Acepta una pregunta en lenguaje natural, carga el estado actual desde Unity Catalog (máquinas, eventos, programación, inventario, calidad, restricciones) y dirige la intención al especialista adecuado.

Cada llamada lee el estado más reciente de UC antes de que se inicie el LLM. El sistema recomienda y redacta borradores de artefactos (tickets, aprobaciones, notas de turno). La ejecución sigue a cargo del gerente de línea, calidad y mantenimiento.

La memoria de conversación corta reside en Lakebase, y el corpus de incidentes pasados en AI Search. Model Serving sirve los modelos y MLflow rastrea cada llamada.

Por qué un equipo de especialistas y no un solo gran agente

Un solo agente genérico simplifica demasiado o pierde el enfoque. El RCA de tiempo de inactividad, el inventario y los cálculos de programación necesitan datos y matemáticas diferentes. Un equipo de especialistas mantiene cada prompt acotado y cada herramienta orientada a la pregunta.

Por ejemplo, el Analista de Tiempos de Inactividad no consume contexto en tablas de inventario, y el Optimizador de Programación no extrae filas de control de calidad sin procesar de la forma en que lo hace el Especialista de Calidad.

EspecialistaQué hace
Downtime AnalystCausa raíz, efecto cascada entre máquinas, prioridad de recuperación; eventos + sensores
Quality SpecialistSPC en llenado, torque, etiquetas, peso de la caja; retención/liberación; riesgo bayesiano
Supply Chain AdvisorDecenas de insumos de línea (por ejemplo, etiquetas, película, cierres, adhesivos, productos químicos de proceso): tasas de consumo, agotamiento, urgencia de reorden
OEE CoachPérdidas de disponibilidad / rendimiento / calidad; Pareto; Genie para tendencias
Schedule OptimizerPlanes de recuperación estocásticos / MILP; compensaciones: costo, riesgo de programación/servicio, rendimiento
Maintenance PredictorAnomalías (Z-score, IQR); señales tipo RUL; compensaciones de PM
Strategic AdvisorTendencias de múltiples turnos; hoja de ruta de mejora; marco CAPEX/OPEX; benchmarking
Shift BriefingLecturas de reunión previa al turno / entrega posterior al turno; optimizado para Genie, resumen enfocado en dispositivos móviles

Herramientas que los especialistas realmente llaman

Los especialistas llaman a un conjunto pequeño y fijo de herramientas. SQL Query y Genie Space extraen lecturas gobernadas, de la misma manera que lo hace el resto de la organización. La Calculadora ejecuta cálculos matemáticos de OEE, recuperación y agotamiento en Python (NumPy y Pandas) sobre la telemetría de Databricks SQL. Un Detector de Anomalías ejecuta Z-score e rango intercuartílico (IQR) sobre ventanas móviles directamente en esas tablas. Plan & Constraints contiene los límites de velocidad por línea, las ventanas de CIP, las reglas de cambio de formato y la política de horas extras. Similar Cases recupera incidentes históricos de Databricks AI Search.

Direccionamiento a un solucionador real, no solo un chat

Muchos copilotos de manufactura son simples capas superficiales sobre LLM. ProdLine dirige las consultas a solucionadores reales (del tipo que utilizan los equipos de investigación de operaciones) a través de lenguaje natural.

OptimizadorMétodoQué resuelve
Schedule RecoveryMILP (OR-Tools SCIP)Velocidad, OT, CIP: óptimo bajo el modelo establecido, no una heurística vaga
Stochastic ScheduleSAA + escenariosPlan robusto a través de la variabilidad de OEE / microparadas
Production ForecastMonte Carlo (por ejemplo, 1,000 trayectorias)Franjas de finalización P10/P50/P90 a partir del historial
Quality RiskBayesian CPTPuntaje de riesgo + factores determinantes
OEE Loss AnalysisParetoClasificar las pérdidas por magnitud / ROI
Multi-Shift PlannerOptimización secuencialVelocidad entre turnos, OT, CIP, PM
RUL EstimatorExtrapolación de tendenciasCompensación en la programación de PM

Intervención humana (human-in-the-loop): cerrar el ciclo sin trabajo adicional

Nada se ejecuta sin la aprobación de un humano. El gerente de línea es responsable de la recuperación, el equipo de calidad se encarga de la retención y liberación, y el de mantenimiento de la orden de trabajo. El objetivo es reducir la carga cognitiva de saltar entre hojas de cálculo, radios y paneles de control, no eliminar al gerente de producción.

Debe responder a tres preguntas en menos de un minuto: qué está pasando, cuáles son las opciones realistas y cuánto cuesta cada opción en términos de rendimiento, horas extra, calidad y servicio.

Puertas de aprobación (por diseño):

RolAprueba
Gerente de líneaRecuperación: velocidad, horas extra, programación
CalidadRetención/liberación, desviaciones
MantenimientoAlcance del trabajo y tiempos

La demo actual cubre el bucle de razonamiento y recomendación. El siguiente paso es cerrar el bucle con escrituras directas en el sistema (write-backs), todas diseñadas como borradores en lugar de control automático.

La transferencia al CMMS es un borrador de orden de trabajo (fallo diagnosticado, alcance recomendado, tiempo objetivo, piezas necesarias) para que el planificador la programe. Para calidad, el QMS y el LIMS reciben un registro de desviación precargado (lote, máquina, ID de muestras, gravedad, disposición recomendada) que el responsable de calidad revisa y resuelve. El MES y el sistema de planificación y programación avanzada (APS) reciben una actualización de programación preliminar con ajustes de velocidad, horas extra, cambios de secuencia y la justificación de la recuperación, registrada para la ejecución del turno.

La trazabilidad sigue la misma hoja de ruta: cada recomendación almacena sus entradas, suposiciones, restricciones, aprobador y resultado de extremo a extremo, lo que facilita el relevo de turnos y la mejora continua.

De línea piloto a múltiples plantas

La parte más difícil de la implementación en múltiples plantas son los datos, no la IA. Cada planta tiene sus propias máquinas, SOPs y esquemas de LIMS. Lo que hace que la segunda planta sea un aporte incremental en lugar de un proyecto paralelo es la capa de streaming subyacente: cada planta se basa en el mismo patrón de Zerobus, diseño de medallón (medallion layout) y gobernanza de Unity Catalog, con sus propias tablas y Genie Space bajo un espacio de nombres dedicado.

Los optimizadores se mantienen parametrizados. Una tabla line_constraints define los límites de velocidad, límites de horas extra, ventanas de CIP y transiciones, de modo que cambiar los datos cambia el comportamiento, sin necesidad de volver a implementar.

La misma base financia el siguiente caso de uso. Energía y sostenibilidad leen la misma telemetría, la calidad del proveedor se basa en la unión (join) de LIMS y la seguridad se basa en el flujo de eventos. Cada nuevo proyecto se implementa sobre la infraestructura que el primero ya pagó, en lugar de levantar una plataforma paralela.

Llamada a la acción

Clona el repositorio de código y ejecuta databricks bundle deploy en tu propio espacio de trabajo. Para usar los datos de tu propia planta, apunta el productor a tu historiador en lugar de al simulador; Zerobus, el diseño de medallón (medallion layout), las herramientas de agente y los borradores con intervención humana (human-in-the-loop) se mantienen igual. Abre prodline_copilot_film.html en un navegador para ver una demostración animada de dos minutos antes de clonar.

¿Te interesa crear tu propio asistente de monitoreo de línea y te gustaría saber más? Ponte en contacto con tu representante de cuenta de Databricks. Un especialista de Databricks también puede ayudarte a definir el alcance para integrar OT, MES, ERP y LIMS en un solo lakehouse gobernado.

Glosario

Acrónimos utilizados en esta publicación, en orden alfabético.

  • APS – Planificación y programación avanzada (Advanced Planning & Scheduling)
  • CDC – Captura de datos modificados (Change Data Capture)
  • CIP – Limpieza in situ (Clean-In-Place, ciclo de limpieza en una línea de producción)
  • CMMS – Sistema de gestión de mantenimiento computarizado (Computerized Maintenance Management System)
  • CPG – Bienes de consumo empaquetados (Consumer Packaged Goods)
  • ERP – Planificación de recursos empresariales (Enterprise Resource Planning)
  • IQR – Rango intercuartílico (Interquartile Range)
  • LIMS – Sistema de gestión de información de laboratorio (Laboratory Information Management System)
  • LLM – Modelo de lenguaje grande (Large Language Model)
  • MES – Sistema de ejecución de manufactura (Manufacturing Execution System)
  • MILP – Programación lineal entera mixta (Mixed-Integer Linear Programming)
  • OEE – Eficacia general de los equipos (Overall Equipment Effectiveness)
  • OT – Tecnología operativa (Operational Technology, el lado de los sistemas de planta de IT/OT).
  • PLC – Controlador lógico programable (Programmable Logic Controller)
  • QMS – Sistema de gestión de calidad (Quality Management System)
  • RCA – Análisis de causa raíz (Root Cause Analysis)
  • SCADA – Control de supervisión y adquisición de datos (Supervisory Control And Data Acquisition)
  • SOP – Procedimiento operativo estándar (Standard Operating Procedure)

Blogs relacionados de Databricks

(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original

Recibe las últimas publicaciones en tu bandeja de entrada

Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.