Cómo la detección de anomalías en tiempo real detecta interrupciones parciales y silenciosas en minutos, y cómo crear el mismo sistema en Databricks.
Algunas de las interrupciones más dañinas son aquellas que tu monitoreo nunca detecta: una parte de tus clientes experimenta fallas de manera silenciosa mientras que cada verificación de estado sigue mostrándose normal. Estas "fallas grises" provocan la pérdida de usuarios e ingresos durante horas antes de que alguien conecte los puntos. Esta publicación trata sobre cómo detectarlas a tiempo mediante la detección de anomalías: cómo lo hacemos en Databricks con un sistema llamado RADAR y cómo puedes crear lo mismo para cualquier métrica que sea más importante para tu negocio. Está escrito para las personas responsables de la confiabilidad del servicio: SRE, ingenieros de plataformas y datos, personal de guardia y los líderes de ingeniería a quienes reportan.
Imagina un miércoles cualquiera. Tu trabajo es mantener la confiabilidad de un servicio de cara al cliente, y cada panel de control en tu pared está en verde: CPU saludable, latencia correcta, servidores activos, base de datos conectada. Según cada señal que observa tu equipo, el sistema parece perfecto.
No lo está.
Durante casi siete horas, tu monitoreo insistió en que todo estaba bien mientras los clientes se iban y los ingresos se perdían.
Ese miércoles es un ejemplo de manual de una falla gris. En la superficie todo parece saludable; por debajo, una pieza específica ha dejado de funcionar silenciosamente, y afecta a los clientes sin llegar a activar ninguna alerta.
Dos cosas hacen que las fallas grises sean tan engañosas:
Piensa en ello como humo detrás de la pared. Desde fuera, la casa parece estar bien, pero por dentro el daño se está extendiendo; y cuanto más esperes, mayor será el radio de impacto. Los investigadores también tienen un nombre para el problema subyacente: el artículo de Microsoft Gray Failure: The Achilles’ Heel of Cloud-Scale Systems lo llama observabilidad diferencial: tus detectores de fallas no notan un problema incluso cuando tus usuarios claramente sí lo hacen.
La mayoría de los equipos manejan las fallas grises exactamente de la misma manera que ocurrió ese miércoles: esperan a que los clientes se lo digan. Los reportes de los clientes importan (son problemas reales de personas reales), pero tus clientes no deberían ser tu sistema de monitoreo. Depender únicamente de los reportes tiene tres problemas:
La solución no es dejar de leer los tickets; sigue haciéndolo. Consiste en agregar una detección automática que se ejecute todo el tiempo y capte lo que las personas pasan por alto. Concretamente, quieres algo que se active en el momento en que muchos más clientes de lo habitual comiencen a experimentar el mismo problema al mismo tiempo.
| Solo reportes de clientes | Agregar detección automática |
|---|---|
| Manual: fácil de pasar por alto | Detecta lo que las personas pasan por alto |
| Tardío: se nota en días | Rápido: se nota en tiempo real |
| Los clientes sufren en silencio | Identifica el pico: muchos usuarios a la vez |
Esa es la idea detrás de RADAR (Reliability Anomaly Detection, Alerting, and Root-cause analysis). Lo creamos en Databricks para detectar fallas grises en minutos en lugar de horas. El nombre es muy adecuado: cuando la visibilidad es baja, no esperas a que algo te golpee, sino que buscas señales débiles de forma anticipada.
Así es como lo orientamos hacia una señal especialmente útil: los errores de usuario.
Una falla gris a menudo se manifiesta como un pico repentino de errores que parecen ser culpa del usuario. Imagina a un grupo de usuarios en una región que de repente no pueden iniciar un determinado tipo de clúster. Cada solicitud falla con INVALID_ARGUMENT, un error que dice cortésmente: "esto es problema tuyo".
Pero cuando muchos usuarios se topan con el mismo error de "tu culpa" al mismo tiempo, deja de ser su culpa. Es nuestra. Ese pico es exactamente el patrón que RADAR está diseñado para detectar.

RADAR convierte ese instinto en un pipeline con cuatro etapas:
Ejecutar RADAR internamente cambió la forma de estos incidentes. Antes, esperábamos los tickets de los clientes para descubrir tales incidentes, lo que provocaba días de retraso. Con RADAR, logramos una reducción del 95 % en el tiempo de descubrimiento de incidentes, con una precisión superior al 90 %, sin necesidad de que un humano detecte el patrón. Como resultado, podemos mantener controlado el radio de impacto de las fallas grises.
Aquí está la parte que más te importa: a RADAR no le importa cuál sea la métrica. Da la casualidad de que lo apuntamos a los errores de los usuarios, pero el mismo patrón funciona en cualquier lugar donde un número pueda salir mal silenciosamente:
Es el mismo patrón bajo diferentes configuraciones. En cualquier lugar donde tengas algo que pueda salir mal silenciosamente, se aplica RADAR.

La mejor noticia: cada pieza que necesitas ya está en Databricks. Mapea las cuatro etapas en la plataforma y se verá así:
Y todo se despliega como una sola unidad a través de un Declarative Asset Bundle (DAB).
Conectar todas esas partes a mano es la parte molesta, así que la eliminamos. Sintetizamos todo el sistema interno RADAR en una sola plantilla: un archivo markdown que funciona como una receta, mapeando cada parte de RADAR a un componente específico de Databricks (recopilar y almacenar → una tabla Delta; detectar la anomalía → una tarea; alertar y eliminar duplicados → un ticket; visualizar → un dashboard).

Y aquí viene la recompensa. Tú aportas tu propia métrica (dondequiera que esté tu señal) y le entregas la métrica, la plantilla y un prompt corto a un agente de AI. Este construye todo el sistema RADAR por ti, en vivo en Databricks. Puedes seguir las instrucciones de GitHub sobre cómo construir uno a partir de un solo prompt.
Dos ideas para recordar:
Obtén la plantilla de RADAR en GitHub
Porque el mejor resultado no es responder más rápido a los clientes enojados, sino que tus clientes nunca tengan que descubrir los incidentes por ti.
(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original
Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.