Seis casos de uso de IA que puedes ejecutar en SQL puro, reemplazando los notebooks, las API y los pipelines que utilizas hoy en día.
por Srikant Das y Ismail Makhlouf
En la mayoría de las organizaciones, los data warehouses contienen datos estructurados, mientras que los datos no estructurados se guardan en el data lake. Esto funciona bien para las cargas de trabajo de analítica, que consumen datos estructurados a escala para generar un conjunto conocido de informes día tras día.
Sin embargo, las cargas de trabajo de AI requieren entradas diferentes. Los modelos de AI a menudo necesitan analizar datos no estructurados (como reseñas, tickets de soporte y PDFs) y combinarlos con datos estructurados para entrenar, compilar y servir modelos. Por lo tanto, un analista que quiera obtener el sentimiento de los tickets de soporte tiene que enviar las filas a un servicio, esperar las predicciones y volver a unirlas en una tabla de forma manual. Es un proceso lento, se interrumpe cuando cambia un esquema e introduce riesgos innecesarios de seguridad y gobernanza.
AI Functions resuelven esto al llevar la AI directamente a sus datos, en lugar de moverlos a un entorno de AI independiente. Puede invocar modelos dentro de consultas SQL estándar, manteniendo todo el proceso de inferencia dentro de sus pipelines existentes y la gobernanza de Unity Catalog. Esta arquitectura cambia fundamentalmente la forma de trabajar con AI en su data warehouse:
SELECT, puede compilar con AI. Databricks gestiona la complejidad (planificación, paralelización y reintentos) para que no tenga que preocuparse por la gestión de clústeres ni la orquestación externa. Es igual de fácil ejecutar una inferencia en millones de filas que en una sola fila; la misma consulta escala sin necesidad de reescribirla.system.billing.usage junto con los costos estándar de su warehouse de Databricks SQL.ai_classify, ai_extract, ai_translate y ai_parse_document, aprovechará modelos adaptados a trabajos específicos en lugar de pagar de más por una inferencia de propósito general.
Puede utilizar estas funciones de AI desde cualquier lugar de Databricks, incluidos los notebooks, las Lakeflow Spark Declarative Pipelines y Workflow. Pero en esta publicación nos centraremos específicamente en llamar a estas funciones desde Databricks Lakehouse. Los siguientes casos de uso le mostrarán cómo puede integrar estas funciones de AI en cargas de trabajo donde necesite combinar datos estructurados de su data warehouse con datos no estructurados, ya sea de fuera del data warehouse o generándolos usted mismo a través de funciones habilitadas para GenAI.
ai_parse_document actúa como el puente de ingesta que convierte el contenido de archivos binarios sin procesar (como PDFs o imágenes) en texto legible. Una vez analizado, ai_extract se encarga de la extracción detallada de claves y valores específicos. Este enfoque combinado elimina la necesidad de pipelines de OCR personalizados y frágiles o servicios de análisis de terceros que a menudo fallan durante los cambios de esquema.
En este caso de uso, apuntamos ai_parse_document a un volumen de Databricks que contiene facturas. Una vez que se analizan esas facturas, un análisis de documentos con AI produce los resultados en JSON, que luego se pasan a la función ai_extract, en la que definimos qué entidades queremos extraer de esas facturas. El resultado es una tabla estructurada con los campos que queremos extraer de las facturas.
El linaje ahora se ejecuta desde el PDF sin procesar hasta las filas extraídas dentro de un único plan de consulta. El puente que la gente construye manualmente para esto (un servicio de OCR en Python, una llamada de LLM y un paso de aplanamiento de JSON) se reduce por completo a la consulta.
Notebook de demostración: Inteligencia de documentos
La función ai_classify realiza una clasificación zero-shot, asignando comentarios de texto libre a un conjunto específico de etiquetas definidas por el usuario sin necesidad de entrenar el modelo. Este proceso transforma texto desordenado y no estructurado en columnas gobernadas y consultables, lo que hace que los datos de sentimiento y tema estén disponibles de inmediato para los dashboards de BI y los informes ejecutivos.
En este ejemplo, queremos clasificar las reseñas de los clientes de la tabla bronze.nps_responses en positivas, negativas, neutras y mixtas.
Notebook de demostración: Análisis de sentimiento
Con ai_translate, puede normalizar datos multilingües en un único idioma de destino directamente dentro de la capa de consulta. Esto evita los silos de datos y la fragmentación, lo que permite que todos los análisis posteriores (incluidas la clasificación y la extracción) operen en todo el conjunto de datos global simultáneamente, en lugar de procesar solo fragmentos en inglés.
En este ejemplo, extraemos el sentimiento de diferentes reseñas de clientes y luego las traducimos al inglés.
Notebook de demostración: Traducción y normalización
Centrándose en la eficiencia operativa, ai_classify convierte entradas de formato libre, como tickets de soporte o transcripciones de llamadas, en categorías accionables. Al identificar la intención y la urgencia de los comentarios entrantes en el punto de ingesta, permite un enrutamiento automatizado e inteligente a los equipos adecuados o a sistemas de respuesta automatizados.
En el caso de uso que se presenta a continuación, estamos ingiriendo diferentes tickets de soporte de una tabla y luego usando ai_classify para determinar la intención del usuario y la urgencia del ticket.
Notebook de demostración: Clasificación y enrutamiento
La función ai_extract está diseñada para extraer información semiestructurada de contenido de formato largo, como transcripciones de llamadas de ventas, y convertir el texto narrativo en campos estructurados y discretos. Esto aporta un valor significativo al incorporar información cualitativa directamente en las herramientas de BI, transformando de manera efectiva las conversaciones habladas en métricas consultables, como la etapa del acuerdo y los indicadores de riesgo.
En este caso de uso, analizamos una transcripción larga para identificar cuál es el siguiente paso, la etapa del acuerdo, el indicador de riesgo y el motivo del riesgo, de modo que el equipo de ventas pueda tomar medidas basadas en el resultado de la reunión que generó la transcripción.
Notebook de demostración: Extracción de llamadas de ventas
ai_query es la función más general y la base de las demás: le permite enviar un prompt a cualquier punto de servicio de Foundation Model alojado en Databricks al que tenga acceso, y devolverá la respuesta del modelo para cada fila.
En este caso de uso, podemos usar ai_query para redactar un correo electrónico de propuesta de renovación para cada cuenta de cliente en la tabla ficticia gold.renewal_signals, que nos muestra qué cuentas están listas para la renovación.
Como usted escribe el prompt, puede hacer cualquier cosa que el modelo pueda hacer, razón por la cual maneja los casos que las funciones más específicas no cubren.
Notebook de demostración: Redacción generativa
El hilo conductor de los seis casos es el mismo. La IA se ejecuta en el mismo lugar que el resto del warehouse: una sola plataforma, un solo modelo de gobernanza, una sola factura y un solo conjunto de pipelines. Cualquier línea de su ETL de SQL existente puede incorporar un paso de IA sin necesidad de implementar un sistema para alojarlo, y cada script de Python que antes se usaba de forma independiente para traducir, puntuar o clasificar datos se convierte en candidato para ser reemplazado por una sola línea.
Así que comience con una sola columna. Tome la carga de trabajo donde el servicio actual sea más frágil, vuelva a escribirla como un SELECT, ejecútela en 10,000 filas y lea el resultado. Sabrá después de una prueba rápida si se adapta, y habrá dejado de pagar el costo adicional de transferir datos fuera del sistema solo para usarlos.
Cada notebook incluye datos de muestra integrados, el paso a paso de SQL y el resultado esperado.
(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original
Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.