Una guía sobre las personas, los procesos y las tecnologías necesarios para implementar agentes de AI gobernados y confiables a escala empresarial
AgentOps es la disciplina operativa para crear, desplegar y mejorar agentes de AI en producción. Reúne la arquitectura, la evaluación, la observabilidad, la gobernanza, la seguridad y la gestión de costos en un proceso que los equipos pueden repetir.
Un agente de AI es más que un modelo que genera una respuesta. Los agentes pueden elegir herramientas en tiempo de ejecución, recuperar datos empresariales, llamar a APIs y realizar tareas de varios pasos por sí mismos. Cada una de estas capacidades es un punto donde algo puede salir mal, como una llamada de herramienta fallida, un permiso demasiado amplio o un aumento inesperado en los costos.
AgentOps existe para evitar que esa complejidad se convierta en un problema. Si se hace bien, hace que un sistema sea lo suficientemente confiable como para que la gente confíe en él y lo suficientemente simple como para que un equipo pueda operarlo realmente.
La AI generativa ha pasado de la experimentación a la empresa más rápido que la mayoría de las olas tecnológicas. El próximo desafío es convertir los pilotos prometedores en sistemas en los que la gente pueda confiar.
La mayoría de los equipos se estancan en las mismas preguntas operativas:
Responder a esas preguntas requiere más que un modelo más potente. Requiere un modelo operativo para el propio agente.
Este es un territorio familiar. MLOps maduró a medida que los equipos trasladaban los modelos de machine learning fuera de los notebooks y hacia la producción. LLMOps le siguió, agregando prácticas para el control de versiones de prompts y modelos, servicio distribuido y control de costos. AgentOps es la siguiente capa y extiende esa disciplina a sistemas que razonan, usan herramientas y toman medidas por sí mismos.
Un agente en producción necesita límites claros sobre lo que pueden tocar sus herramientas, un registro rastreable de la ejecución de varios pasos, una forma de medir la calidad, un plan para cuando algo falle y suficiente alineación entre ingeniería, producto, seguridad, cumplimiento y finanzas para que nadie se sorprenda cuando se lance.
La experiencia del cliente así lo demuestra. El agente de conocimiento de texto a código de FactSet evolucionó de un único modelo fundacional a un sistema de agentes completo y ofreció una mejora del 44% en la precisión. Lea la historia de FactSet.
El Gran Libro de AgentOps codifica las prácticas que ayudan a los equipos empresariales a realizar esa transición: patrones de arquitectura, un pipeline de entrega por fases, bucles de evaluación y retroalimentación, gobernanza, gestión de costos y las decisiones de las partes interesadas que determinan si un agente realmente llega a producción.
El libro avanza desde los conceptos hasta la implementación a lo largo de seis capítulos.
Los agentes no son lo mismo que una llamada de LLM de prompt y respuesta.
El registro, las puertas de evaluación, la gobernanza, el rollback y el monitoreo son importantes, pero los requisitos varían según las cuatro arquitecturas de agentes. Describimos cada arquitectura y sus correspondientes requisitos operativos para facilitar su consulta.
Además, igual de importantes son los antipatrones que impiden que los pilotos se implementen: comenzar con un caso de uso demasiado amplio, recurrir a la orquestación de múltiples agentes antes de que la complejidad esté justificada, tener un bucle de razonamiento innecesario y dejar la evaluación para más tarde de lo debido. Compartimos una lista de los más comunes que hemos visto para que se puedan evitar errores similares.
Las arquitecturas de despliegue varían de simples a complejas según el caso de uso y las necesidades de la organización. Cubrimos cuatro patrones de despliegue que van desde el despliegue desde un único espacio de trabajo de Databricks hasta la configuración más compleja: una topología empresarial multi-cuenta y multi-agente. Cada patrón viene con orientación sobre cómo seleccionar y evolucionar entre patrones a medida que cambian sus necesidades. En cada etapa, Unity Catalog, Unity Gateway y MLflow siguen siendo el núcleo del soporte de la arquitectura.
Una hoja de ruta de siete fases que comienza con cómo formar un equipo, seleccionar un caso de uso, hasta la configuración de la infraestructura de datos, los bucles de evaluación y las mejores prácticas de gobernanza.
Destacamos aspectos importantes a tener en cuenta para cada fase. Por ejemplo, el costo es una parte importante del ciclo de vida. Una sola solicitud de usuario puede activar varias llamadas al modelo una vez que se tienen en cuenta los subagentes, los reintentos y las comprobaciones de guardrails. Eso hace que sea fundamental atribuir el uso, establecer límites y definir una responsabilidad clara para el gasto.
Los equipos necesitan iterar rápidamente para desarrollar un agente de alta calidad. También necesitan evolucionar un agente en función de los avances en la frontera de la investigación y en respuesta a las necesidades cambiantes de su organización. Para abordar esto, destacamos cómo los principios de flujo, retroalimentación y aprendizaje continuo, tomados de The DevOps Handbook, proporcionan una base útil para operar sistemas de agentes de AI.
Aplicar estos principios a los sistemas de agentes significa construir un conjunto de datos de evaluación de referencia (golden dataset) a partir de trazas reales, calibrar jueces automatizados con la retroalimentación de expertos en la materia (SMEs) y utilizar los resultados de la evaluación para guiar lo que se construirá a continuación. Un ejemplo práctico de un agente de correo electrónico para clientes muestra cómo la revisión humana, los jueces basados en modelos y las comprobaciones basadas en reglas funcionan juntos sin convertir cada lanzamiento en una auditoría manual.
Una secuencia de planificación de seis pasos ayuda a los equipos a concentrar sus esfuerzos donde realmente cambia el resultado: mapear el flujo de trabajo humano, traducirlo a una arquitectura técnica, definir las necesidades de observabilidad por rol (persona), diseñar el rastreo en el sistema, mapear los controles de acceso a los datos y herramientas, e identificar qué se puede reutilizar.
Un agente de soporte al cliente de telecomunicaciones pone en práctica la secuencia, incluyendo los esquemas de datos, las herramientas disponibles para un subagente de facturación y los controles detallados que evitan que un cliente vea los datos de otro.
Una buena ingeniería no garantiza que un agente llegue a producción. Muchos proyectos técnicamente sólidos se estancan debido a problemas de personas.
La preparación para la producción depende de que las partes interesadas estén alineadas en toda la organización, desde los patrocinadores ejecutivos y los propietarios de productos hasta los SMEs, seguridad, cumplimiento y finanzas. Esta sección proporciona una matriz RACI práctica que aclara la propiedad de las decisiones que suelen estancarse y sugiere frecuencias de comunicación para las fases del proyecto previas y posteriores al lanzamiento. Estos proceso de equipo permiten que los estrechos bucles de retroalimentación de los SMEs aseguren que el monitoreo operativo y las revisiones posteriores al lanzamiento se realicen sin problemas, y que los proyectos aporten valor a largo plazo.
Elija un caso de uso bien definido con métricas de éxito claras antes de recurrir a la orquestación. Presente un prototipo funcional a las partes interesadas desde el principio. Deje que lo que aprenda, y no una hoja de ruta preestablecida, decida qué se construirá a continuación.
DXC Technology tomó este camino mientras expandía su portafolio de AI. La empresa ahora opera tres agentes de AI en producción, tiene ocho más en piloto o desarrollo, y redujo el costo total de propiedad de la plataforma en un 30% después de migrar a Databricks. Lea la historia de DXC Technology.
La evaluación es lo que permite a un equipo lanzar un agente con confianza y seguir actualizándolo de forma segura después. Comience con SMEs que revisen trazas reales, no un puñado de prompts de chat seleccionados a mano. Ese juicio humano revela modos de falla, construye un conjunto de evaluación representativo y calibra los jueces automatizados que eventualmente se harán cargo de las comprobaciones de rutina.
Databricks incorpora esto directamente en la plataforma: evaluación de agentes, jueces asistidos por AI y análisis basado en trazas que permiten a los equipos encontrar problemas de producción, profundizar en las causas raíz y probar una solución antes de volver a desplegar.
Intercontinental Exchange (ICE) puso esto en práctica en una aplicación gobernada de texto a SQL que responde a preguntas comerciales utilizando datos financieros, logrando un 77% de precisión sintáctica y un 96% de coincidencias de ejecución en aproximadamente 50 consultas.
Los controles que residen dentro de aplicaciones individuales se vuelven más difíciles de auditar a medida que crece el número de agentes. Un enfoque de plataforma ofrece a los equipos un único lugar para gestionar el acceso a los datos, el uso de modelos y herramientas, el rastreo, la evaluación y la aplicación de políticas, en lugar de reinventar la gobernanza para cada nuevo agente.
En Databricks, esa base es MLflow para evaluación y rastreo, Unity Gateway para el tráfico de modelos y herramientas, y Unity Catalog para el descubrimiento gobernado, permisos, linaje y control de acceso en todos los activos de datos y AI.
Block es un buen ejemplo de lo que aporta una base gobernada. Su entorno de Databricks admite tanto casos de uso de AI como operativos, con Unity Catalog gestionando el acceso a los datos en todas las unidades de negocio. Databricks reporta 10 millones de dólares en ganancias de productividad gracias al sistema de agentes de AI de Block para las operaciones de los vendedores.
The Big Book of AgentOps está escrito para cualquier persona responsable de poner un agente de AI en producción o de mantenerlo allí una vez que esté activo:
Cualquier persona cuyos usuarios dependan del comportamiento del agente debería tener este libro en su escritorio.
Lee el eBook completo para profundizar y explorar las capacidades de la plataforma detrás de los agentes de AI en producción:
Es el conjunto de prácticas para crear, evaluar, desplegar, gobernar, observar y mejorar los agentes de AI una vez que están activos, y la disciplina operativa que mantiene a un sistema razonando, utilizando herramientas y tomando medidas de manera confiable.
Porque pueden ocurrir muchas cosas entre la llegada de una solicitud y la salida de una respuesta: llamadas a herramientas, recuperación, comprobaciones de permisos, reintentos y orquestación. Cada una de ellas afecta la calidad, el riesgo, la latencia o el costo, y ninguna de ellas se muestra si solo estás observando el resultado final del modelo.
Panoramas de agentes y antipatrones, arquitecturas de despliegue, un pipeline de proyecto de siete fases, bucles de evaluación y retroalimentación, prácticas de DevOps adaptadas para sistemas no deterministas, actividades de planificación de alto impacto y gestión de partes interesadas.
Elige un caso de uso acotado con criterios de éxito medibles. Crea un conjunto de evaluación a partir de ejemplos reales, rastrea lo que realmente hace el agente, aplica una gobernanza de privilegios mínimos y establece un ritmo operativo antes de expandirte a una orquestación más compleja.
(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original
Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.