Ir al contenido principal
Plataforma

Uso de AI_Functions en tu almacén de datos: principales casos de uso

Seis casos de uso de IA que puedes ejecutar en SQL puro, reemplazando los notebooks, las API y los pipelines que utilizas hoy en día.

por Srikant Das y Ismail Makhlouf

En la mayoría de las organizaciones, los data warehouses contienen datos estructurados, mientras que los datos no estructurados se guardan en el data lake. Esto funciona bien para las cargas de trabajo de analítica, que consumen datos estructurados a escala para generar un conjunto conocido de informes día tras día.

Sin embargo, las cargas de trabajo de AI requieren entradas diferentes. Los modelos de AI a menudo necesitan analizar datos no estructurados (como reseñas, tickets de soporte y PDFs) y combinarlos con datos estructurados para entrenar, compilar y servir modelos. Por lo tanto, un analista que quiera obtener el sentimiento de los tickets de soporte tiene que enviar las filas a un servicio, esperar las predicciones y volver a unirlas en una tabla de forma manual. Es un proceso lento, se interrumpe cuando cambia un esquema e introduce riesgos innecesarios de seguridad y gobernanza.

AI Functions resuelven esto al llevar la AI directamente a sus datos, en lugar de moverlos a un entorno de AI independiente. Puede invocar modelos dentro de consultas SQL estándar, manteniendo todo el proceso de inferencia dentro de sus pipelines existentes y la gobernanza de Unity Catalog. Esta arquitectura cambia fundamentalmente la forma de trabajar con AI en su data warehouse:

  • Gobernanza por defecto: Debido a que AI Functions respetan los permisos de Unity Catalog, sus datos permanecen seguros y privados. El modelo solo accede a los datos que usted permita explícitamente.
  • Simplicidad nativa de SQL: Si puede escribir una instrucción SELECT, puede compilar con AI. Databricks gestiona la complejidad (planificación, paralelización y reintentos) para que no tenga que preocuparse por la gestión de clústeres ni la orquestación externa. Es igual de fácil ejecutar una inferencia en millones de filas que en una sola fila; la misma consulta escala sin necesidad de reescribirla.
  • Facturación unificada: Elimine la complejidad de conciliar diferentes dashboards. El uso de AI aparece en system.billing.usage junto con los costos estándar de su warehouse de Databricks SQL.
  • Funciones especializadas: Obtenga mejores resultados a un menor costo. Al utilizar funciones específicas para cada tarea, como ai_classify, ai_extract, ai_translate y ai_parse_document, aprovechará modelos adaptados a trabajos específicos en lugar de pagar de más por una inferencia de propósito general.

image3.png

Puede utilizar estas funciones de AI desde cualquier lugar de Databricks, incluidos los notebooks, las Lakeflow Spark Declarative Pipelines y Workflow. Pero en esta publicación nos centraremos específicamente en llamar a estas funciones desde Databricks Lakehouse. Los siguientes casos de uso le mostrarán cómo puede integrar estas funciones de AI en cargas de trabajo donde necesite combinar datos estructurados de su data warehouse con datos no estructurados, ya sea de fuera del data warehouse o generándolos usted mismo a través de funciones habilitadas para GenAI.

Caso de uso 1: Inteligencia de documentos, de archivos sin procesar a filas estructuradas

ai_parse_document actúa como el puente de ingesta que convierte el contenido de archivos binarios sin procesar (como PDFs o imágenes) en texto legible. Una vez analizado, ai_extract se encarga de la extracción detallada de claves y valores específicos. Este enfoque combinado elimina la necesidad de pipelines de OCR personalizados y frágiles o servicios de análisis de terceros que a menudo fallan durante los cambios de esquema.

En este caso de uso, apuntamos ai_parse_document a un volumen de Databricks que contiene facturas. Una vez que se analizan esas facturas, un análisis de documentos con AI produce los resultados en JSON, que luego se pasan a la función ai_extract, en la que definimos qué entidades queremos extraer de esas facturas. El resultado es una tabla estructurada con los campos que queremos extraer de las facturas.

El linaje ahora se ejecuta desde el PDF sin procesar hasta las filas extraídas dentro de un único plan de consulta. El puente que la gente construye manualmente para esto (un servicio de OCR en Python, una llamada de LLM y un paso de aplanamiento de JSON) se reduce por completo a la consulta.

Notebook de demostración: Inteligencia de documentos

Caso de uso 2: Análisis de sentimiento en los comentarios de los clientes

La función ai_classify realiza una clasificación zero-shot, asignando comentarios de texto libre a un conjunto específico de etiquetas definidas por el usuario sin necesidad de entrenar el modelo. Este proceso transforma texto desordenado y no estructurado en columnas gobernadas y consultables, lo que hace que los datos de sentimiento y tema estén disponibles de inmediato para los dashboards de BI y los informes ejecutivos.

En este ejemplo, queremos clasificar las reseñas de los clientes de la tabla bronze.nps_responses en positivas, negativas, neutras y mixtas.

Notebook de demostración: Análisis de sentimiento

Caso de uso 3: Traducción en línea para datos multilingües

Con ai_translate, puede normalizar datos multilingües en un único idioma de destino directamente dentro de la capa de consulta. Esto evita los silos de datos y la fragmentación, lo que permite que todos los análisis posteriores (incluidas la clasificación y la extracción) operen en todo el conjunto de datos global simultáneamente, en lugar de procesar solo fragmentos en inglés.

En este ejemplo, extraemos el sentimiento de diferentes reseñas de clientes y luego las traducimos al inglés.

Notebook de demostración: Traducción y normalización

Caso de uso 4: Clasificación y enrutamiento a escala

Centrándose en la eficiencia operativa, ai_classify convierte entradas de formato libre, como tickets de soporte o transcripciones de llamadas, en categorías accionables. Al identificar la intención y la urgencia de los comentarios entrantes en el punto de ingesta, permite un enrutamiento automatizado e inteligente a los equipos adecuados o a sistemas de respuesta automatizados.

En el caso de uso que se presenta a continuación, estamos ingiriendo diferentes tickets de soporte de una tabla y luego usando ai_classify para determinar la intención del usuario y la urgencia del ticket.

Notebook de demostración: Clasificación y enrutamiento

Caso de uso 5: Extracción estructurada de llamadas de ventas con ai_extract

La función ai_extract está diseñada para extraer información semiestructurada de contenido de formato largo, como transcripciones de llamadas de ventas, y convertir el texto narrativo en campos estructurados y discretos. Esto aporta un valor significativo al incorporar información cualitativa directamente en las herramientas de BI, transformando de manera efectiva las conversaciones habladas en métricas consultables, como la etapa del acuerdo y los indicadores de riesgo.

En este caso de uso, analizamos una transcripción larga para identificar cuál es el siguiente paso, la etapa del acuerdo, el indicador de riesgo y el motivo del riesgo, de modo que el equipo de ventas pueda tomar medidas basadas en el resultado de la reunión que generó la transcripción.

Notebook de demostración: Extracción de llamadas de ventas

Caso de uso 6: Redacción generativa con ai_query

ai_query es la función más general y la base de las demás: le permite enviar un prompt a cualquier punto de servicio de Foundation Model alojado en Databricks al que tenga acceso, y devolverá la respuesta del modelo para cada fila.

En este caso de uso, podemos usar ai_query para redactar un correo electrónico de propuesta de renovación para cada cuenta de cliente en la tabla ficticia gold.renewal_signals, que nos muestra qué cuentas están listas para la renovación.

Como usted escribe el prompt, puede hacer cualquier cosa que el modelo pueda hacer, razón por la cual maneja los casos que las funciones más específicas no cubren.

Notebook de demostración: Redacción generativa

Consejos profesionales para producción

  • Etiquete los trabajos desde el primer día: esto le permitirá atribuir el costo de las AI Functions a los trabajos correctos
  • Pruebe primero la función específica para la tarea: use ai_query solo cuando ninguna de las funciones ai_classify, ai_extract, ai_parse_document o ai_translate se adapte
  • Solicite un resultado estructurado: para ai_query, use responseFormat para obtener un resultado estructurado. Si pasa un esquema DDL STRUCT, obtendrá campos con tipo en lugar de cadenas de texto sin formato; los formatos JSON-schema/json_object siguen devolviendo cadenas JSON.
  • Sea deliberado al elegir el modelo: cada modelo fundacional tiene sus ventajas y desventajas, incluidos el costo, el rendimiento y los formatos de entrada admitidos. Asegúrese de elegir a conciencia qué modelo desea para cada caso de uso
  • Pruebe una muestra antes de escalar: ejecute al menos 10,000 filas, revise el resultado y luego ejecute el resto. La relación costo-precisión es específica de cada caso de uso.
  • Trate los prompts como código: contróleles las versiones, revíselos en pull requests y coméntelos. En este flujo de trabajo, un prompt es una transformación que contiene lógica de negocio

Qué significa esto para su estrategia de data warehouse

El hilo conductor de los seis casos es el mismo. La IA se ejecuta en el mismo lugar que el resto del warehouse: una sola plataforma, un solo modelo de gobernanza, una sola factura y un solo conjunto de pipelines. Cualquier línea de su ETL de SQL existente puede incorporar un paso de IA sin necesidad de implementar un sistema para alojarlo, y cada script de Python que antes se usaba de forma independiente para traducir, puntuar o clasificar datos se convierte en candidato para ser reemplazado por una sola línea.

Así que comience con una sola columna. Tome la carga de trabajo donde el servicio actual sea más frágil, vuelva a escribirla como un SELECT, ejecútela en 10,000 filas y lea el resultado. Sabrá después de una prueba rápida si se adapta, y habrá dejado de pagar el costo adicional de transferir datos fuera del sistema solo para usarlos.

Notebooks de demostración

Cada notebook incluye datos de muestra integrados, el paso a paso de SQL y el resultado esperado.

Lecturas recomendadas

(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original

Recibe las últimas publicaciones en tu bandeja de entrada

Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.