Infraestructura para la gestión del ciclo de vida de las funciones, que incluye ingeniería, almacenamiento, descubrimiento, supervisión y gobernanza con API para la creación y el servicio.

Hasta hace dos años, solo las grandes empresas tecnológicas tenían los recursos y la experiencia necesarios para crear productos que dependieran por completo de los sistemas de aprendizaje automático. Piensa en Google gestionando las subastas de anuncios, TikTok recomendando contenido y Uber ajustando dinámicamente los precios. Para impulsar sus aplicaciones más críticas con aprendizaje automático, estos equipos crearon una infraestructura personalizada que satisfacía las necesidades únicas de la implementación de los sistemas de aprendizaje automático.
Con el paso de los años, ha surgido todo un ecosistema de herramientas de MLOps para democratizar el aprendizaje automático en producción. Pero al tener cientos de herramientas diferentes, entender qué hace cada una es ahora un trabajo a tiempo completo. Las plataformas de características y sus equivalentes, los almacenes de características, son una parte popular de ese ecosistema. En pocas palabras, una plataforma de características habilita su infraestructura de datos existente (almacenes de datos, infraestructura de transmisión como Kafka, procesadores de datos como Spark/Flink, etc.) para aplicaciones operativas de ML. Esta publicación explica con más detalle qué son las plataformas de características y qué problemas resuelven.
Las plataformas de características permiten el aprendizaje automático (ML) operativo, que ocurre cuando una aplicación orientada al cliente utiliza ML de manera autónoma y continua para tomar decisiones que impactan el negocio en tiempo real. Los ejemplos que compartí de Google, TikTok y Uber son todos aplicaciones operativas de ML. Cualquier proyecto de aprendizaje automático consta siempre de cuatro etapas:

La mayoría de los proyectos nunca pasan de la etapa de desarrollo. La producción y el funcionamiento de las aplicaciones de aprendizaje automático siguen siendo el principal obstáculo para los equipos. Y la parte más difícil de producir y operar ML es gestionar las canalizaciones de datos que necesitan alimentar estas aplicaciones continuamente.
Una plataforma de características resuelve los desafíos de datos que se asocian con la producción y la operación. Crea un camino hacia la producción. Entraremos en el detalle de lo que esto significa, pero primero describamos qué es una característica.
En el aprendizaje automático, una característica es el dato que se utiliza como entrada para que los modelos de ML realicen predicciones. Los datos sin procesar rara vez se encuentran en un formato que sea utilizable por un modelo de ML, por lo que es necesario transformarlos en características. Este proceso se denomina ingeniería de características.
Por ejemplo, si una empresa de tarjetas de crédito está tratando de detectar transacciones fraudulentas, una transacción realizada en un país extranjero podría ser un buen indicador de fraude. Las características terminan siendo columnas en los datos que se envían a un modelo.

Lo que es único del ML es que las características se consumen de dos maneras diferentes:
En la etapa de desarrollo de un proyecto de aprendizaje automático, los científicos de datos realizan grandes cantidades de ingeniería de características para encontrar aquellas que conducen a la mayor precisión de predicción. Una vez que se completa ese proceso, generalmente entregan el proyecto a un colega ingeniero que pondrá esas canalizaciones de ingeniería de características en producción.
Si eres un científico de datos, no quieres preocuparte por cómo se disponen los datos ni cómo se calculan. Sabes qué características quieres y deseas que esas características estén disponibles para que el modelo realice predicciones en tiempo real. Los ingenieros, por su parte, necesitan volver a implementar esas canalizaciones de datos en un entorno de producción, lo que rápidamente se vuelve muy complejo en cuanto hay datos en tiempo real o casi en tiempo real. Para potenciar las aplicaciones operacionales de ML, estas canalizaciones se deben ejecutar de manera continua, no pueden romperse, deben ser extremadamente rápidas y deben escalar con el negocio.
La reimplementación de canalizaciones de datos en un entorno de producción es el principal obstáculo para los proyectos operativos de aprendizaje automático. Volviendo al ejemplo de detección de fraude, las características realistas que implementarán las empresas son:
Estas canalizaciones de ingeniería de características son difíciles de implementar. No se pueden calcular directamente en un almacén de datos y requieren configurar una infraestructura de transmisión para procesar datos en tiempo real. Una plataforma de características resuelve los desafíos de ingeniería que supone poner estas características en producción y, al hacerlo, facilita el camino hacia la producción. En concreto, una plataforma de características:
Profundicemos en cómo interactúan los usuarios con una plataforma de características y cuáles son sus componentes.