Sechs KI-Anwendungsfälle, die Sie in reinem SQL ausführen können – als Ersatz für die Notebooks, APIs und Pipelines, die Sie heute verwenden.
von Srikant Das und Ismail Makhlouf
In den meisten Unternehmen enthalten Data Warehouses strukturierte Daten, während unstrukturierte Daten im Data Lake gespeichert werden. Dies funktioniert gut für Analytics-Workloads, die strukturierte Daten in großem Umfang verarbeiten und Tag für Tag eine feste Anzahl von Berichten bereitstellen.
KI-Workloads erfordern jedoch andere Inputs. KI-Modelle müssen oft unstrukturierte Daten – wie Bewertungen, Support-Tickets und PDFs – analysieren und sie mit strukturierten Daten kombinieren, um Modelle zu trainieren, zu erstellen und bereitzustellen. Ein Analyst, der die Stimmung in Support-Tickets auswerten möchte, muss die Zeilen daher an einen externen Dienst senden, auf Vorhersagen warten und sie manuell wieder in eine Tabelle einfügen. Das ist langsam, fehleranfällig bei Schemaänderungen und birgt unnötige Sicherheits- und Governance-Risiken.
AI Functions lösen dies, indem sie die KI direkt zu Ihren Daten bringen, anstatt Ihre Daten in eine separate KI-Umgebung zu verschieben. Sie rufen Modelle innerhalb von Standard-SQL-Abfragen auf und halten den gesamten Inferenzprozess innerhalb Ihrer bestehenden Pipelines und der Governance von Unity Catalog. Diese Architektur verändert grundlegend, wie Sie mit KI in Ihrem Data Warehouse arbeiten:
SELECT-Anweisung schreiben können, können Sie mit KI entwickeln. Databricks verwaltet die Komplexität – Planung, Parallelisierung und Wiederholungsversuche –, sodass Sie sich keine Gedanken über Cluster-Management oder externe Orchestrierung machen müssen. Es ist genauso einfach, eine Inferenz für Millionen von Zeilen wie für eine einzelne Zeile auszuführen; dieselbe Abfrage skaliert ohne Umschreiben.system.billing.usage direkt neben Ihren standardmäßigen Databricks SQL-Warehouse-Kosten aufgeführt.ai_classify, ai_extract, ai_translate und ai_parse_document – nutzen Sie Modelle, die auf bestimmte Aufgaben zugeschnitten sind, anstatt zu viel für allgemeine Inferenz zu bezahlen.
Sie können diese AI Functions von überall in Databricks aus nutzen, einschließlich Notebooks, Lakeflow Spark Declarative Pipelines und Workflows. In diesem Beitrag konzentrieren wir uns jedoch speziell auf den Aufruf dieser Funktionen aus dem Databricks Lakehouse. Die folgenden Anwendungsfälle zeigen Ihnen, wie Sie diese AI Functions in Workloads integrieren können, bei denen Sie strukturierte Daten in Ihrem Data Warehouse mit unstrukturierten Daten kombinieren müssen – entweder von außerhalb des Data Warehouse oder indem Sie diese selbst über GenAI-gestützte Funktionen generieren.
ai_parse_document fungiert als Ingestion-Brücke, die unstrukturierte binäre Dateiinhalte – wie PDFs oder Bilder – in lesbaren Text umwandelt. Nach dem Parsen übernimmt ai_extract die granulare Extraktion bestimmter Schlüssel und Werte. Dieser kombinierte Ansatz macht fehleranfällige, benutzerdefinierte OCR-Pipelines oder Parsing-Dienste von Drittanbietern überflüssig, die bei Schemaänderungen häufig fehlschlagen.
In diesem Anwendungsfall verweisen wir mit ai_parse_document auf ein Databricks-Volume, das Rechnungen enthält. Sobald diese Rechnungen analysiert wurden, liefert die Funktion „AI Parse Document“ die Ergebnisse im JSON-Format. Diese werden dann an die Funktion ai_extract übergeben, in der wir definieren, welche Entitäten wir aus diesen Rechnungen extrahieren möchten. Das Ergebnis ist eine strukturierte Tabelle mit den Feldern, die wir aus den Rechnungen extrahieren wollten.
Die Lineage verläuft nun vom rohen PDF bis zu den extrahierten Zeilen innerhalb eines einzigen Abfrageplans. Die Brücke, die man dafür normalerweise manuell baut – ein Python-OCR-Dienst, ein LLM-Aufruf und ein JSON-Flattening-Schritt –, wird komplett in der Abfrage zusammengefasst.
Demo-Notebook: Document Intelligence
Die Funktion ai_classify führt eine Zero-Shot-Klassifizierung durch und ordnet Freitext-Feedback einer bestimmten Reihe von benutzerdefinierten Labels zu, ohne dass ein Modelltraining erforderlich ist. Dieser Prozess transformiert ungeordneten, unstrukturierten Text in kontrollierte, abfragbare Spalten, sodass Sentiment- und Themendaten sofort für BI-Dashboards und das Management-Reporting verfügbar sind.
In diesem Beispiel möchten wir Kundenbewertungen aus der Tabelle „bronze.nps_responses“ in die Kategorien „positiv“, „negativ“, „neutral“ und „gemischt“ klassifizieren.
Demo-Notebook: Sentiment-Analyse
Mit ai_translate können Sie mehrsprachige Daten direkt innerhalb der Abfrageebene in eine einzige Zielsprache normalisieren. Dies verhindert Datensilos und Fragmentierung, sodass alle nachgelagerten Analysen (einschließlich Klassifizierung und Extraktion) gleichzeitig auf dem gesamten globalen Datensatz operieren können, anstatt nur englischsprachige Segmente zu verarbeiten.
In diesem Beispiel extrahieren wir das Sentiment aus verschiedenen Kundenbewertungen und übersetzen sie anschließend ins Englische.
Demo-Notebook: Übersetzung und Normalisierung
Mit Fokus auf operative Effizienz konvertiert ai_classify Freiform-Eingaben wie Support-Tickets oder Gesprächsprotokolle in umsetzbare Kategorien. Durch die Identifizierung von Absicht und Dringlichkeit des eingehenden Feedbacks direkt beim Ingestion-Prozess wird ein automatisiertes, intelligentes Routing an die entsprechenden Teams oder automatisierten Antwortsysteme ermöglicht.
Im folgenden Anwendungsfall erfassen wir verschiedene Support-Tickets aus einer Tabelle und verwenden dann ai_classify, um die Absicht des Benutzers und die Dringlichkeit des Tickets zu bestimmen.
Demo-Notebook: Klassifizierung und Routing
Die Funktion ai_extract ist dafür konzipiert, semistrukturierte Informationen aus längeren Inhalten wie Transkripten von Verkaufsgesprächen zu extrahieren und Fließtext in diskrete, strukturierte Felder umzuwandeln.
Dies bietet einen erheblichen Mehrwert, da qualitative Informationen direkt in BI-Tools einfließen. So werden gesprochene Gespräche effektiv in abfragbare Metriken wie die Deal-Phase oder Risikowarnungen umgewandelt.
In diesem Anwendungsfall analysieren wir ein langes Transkript, um den nächsten Schritt, die Deal-Phase, die Risikowarnung und den Risikogrund zu identifizieren. So können Vertriebsmitarbeiter direkt auf die Ergebnisse des Meetings reagieren, aus dem das Transkript stammt.
Demo-Notebook: Extraktion aus Verkaufsgesprächen
ai_query ist die allgemeinste Funktion und die Grundlage für alle anderen: Sie ermöglicht es Ihnen, einen Prompt an jeden Serving-Endpunkt für von Databricks gehostete Foundation Models zu senden, auf den Sie Zugriff haben, und gibt für jede Zeile die Antwort des Modells zurück.
In diesem Anwendungsfall können wir ai_query nutzen, um für jedes Kundenkonto in der fiktiven Tabelle gold.renewal_signals, die uns zeigt, welche Konten für eine Verlängerung bereit sind, einen Entwurf für eine E-Mail zur Vertragsverlängerung zu erstellen.
Da Sie den Prompt selbst schreiben, kann die Funktion alles tun, was das Modell tun kann. Deshalb deckt sie die Fälle ab, für die es keine spezielleren Funktionen gibt.
Demo-Notebook: Generatives Entwerfen
Der rote Faden durch alle sechs Anwendungsfälle ist derselbe. Die KI läuft am selben Ort wie der Rest des Warehouses: eine Plattform, ein Governance-Modell, eine Abrechnung, ein Satz von Pipelines. Jede Zeile Ihres bestehenden SQL-ETL-Prozesses kann einen KI-Schritt aufnehmen, ohne dass Sie ein separates System für das Hosting einrichten müssen. Und jedes Python-Skript, das bisher nebenbei Daten übersetzt, bewertet oder klassifiziert hat, kann nun durch eine einzige Zeile ersetzt werden.
Fangen Sie also mit einer Spalte an. Nehmen Sie den Workload, bei dem der aktuelle Service am anfälligsten ist, schreiben Sie ihn als SELECT um, führen Sie ihn für 10.000 Zeilen aus und lesen Sie das Ergebnis. Nach einem kurzen Sprint wissen Sie, ob es passt – und Sie zahlen nicht mehr den zusätzlichen Aufwand für den Datenexport, nur um diese nutzen zu können.
Jedes Notebook enthält direkt integrierte Beispieldaten, die SQL-Schritte und die zu erwartende Ausgabe.
(Dieser Blogbeitrag wurde mit KI-gestützten Tools übersetzt.) Originalbeitrag
Abonnieren Sie unseren Blog und erhalten Sie die neuesten Beiträge direkt in Ihren Posteingang.