Direkt zum Hauptinhalt
Kunden

Von Daten zum Dialog: Wie S&P Global Energy seine strukturierte Datenlandschaft mit Databricks Genie-Agenten und MCP dialogfähig gemacht hat

Wie S&P Global Energy Databricks Genie Agents und FastMCP nutzte, um komplexe strukturierte Daten in konversationelle AI-Endpunkte zu verwandeln

von Debaprasad Satapathy und Eric Henderson

• Fachexperten kuratieren fokussierte Genie Agents pro Datensatzgruppe, ohne Agent-Code zu schreiben, und etablieren so eine governed semantische Schicht.
• Genie Agents fungieren als verwaltete MCP-Server, die über einen FastMCP-Proxy zu zusammengesetzten Endpunkten für domänenübergreifende Abfragen kombiniert werden.
• Diese Architektur verkürzte die Time-to-Market für konversationelle Datenprodukte erheblich, während die Unity Catalog-Governance beibehalten wurde.

Das Ziel von S&P Global war es, grundlegend zu verbessern, wie Kunden Erkenntnisse in unseren Daten- und Research-Produkten entdecken und nutzen. Während AI-gestützte Suche und Zusammenfassungen wichtig sind, liegt der größere geschäftliche Nutzen darin, eine schnellere Entscheidungsfindung zu ermöglichen – durch den Zugang zu vertrauenswürdigen Daten in natürlicher Sprache, umfassendere rohstoffübergreifende Analysen und die Möglichkeit, Erkenntnisse zu verknüpfen, die traditionell in separaten Geschäftsbereichen liegen. AI-Agents helfen Kunden, Zusammenhänge aufzudecken, Recherchen effizienter zu erstellen und verwertbare Erkenntnisse aus einer breiteren Informationsbasis zu gewinnen, als es bisher möglich war.   —Priyanka John, Vice President, S&P Global Energy

Wenn Sie jemals versucht haben, einen großen, komplexen strukturierten Datenbestand für AI-Agents und -Assistenten verfügbar zu machen, sind Sie wahrscheinlich an dieselbe Grenze gestoßen wie wir: Agents sind nur so gut wie der Kontext, auf den sie zugreifen können, und Unternehmensdaten liegen selten an einem einzigen, ordentlichen und gut dokumentierten Ort.

Bei S&P Global Energy umfassen unsere Daten Chemikalien, Rohöl, raffinierte Produkte, Gas & Strom, verflüssigtes Erdgas (LNG) und mehr – und jeder Rohstoff ist für sich genommen eine umfangreiche Familie von Datensätzen. LNG allein umfasst Anlagenspezifikationen, Ladungen, Ausfälle, Angebots- und Nachfragegrundlagen, Netbacks, historische und prognostizierte Preise sowie Verträge. Chemikalien decken Kapazität, Produktion, Auslastung, Handel, Nachfrage nach Endverwendung und Derivaten, Bestandsveränderungen sowie Angebots-Nachfrage-Bilanzen auf Länder- und Regionalebene ab. Unsere anderen Rohstoffe folgen ähnlichen Mustern. Diese Daten verteilen sich auf Databricks und mehrere Nicht-Databricks-Quellen.

Unser Ziel war ehrgeizig, aber einfach zu formulieren: unseren gesamten strukturierten Datenbestand für die externe Nutzung durch AI-Agents über das Model Context Protocol (MCP) verfügbar zu machen – damit die Agents und Assistenten unserer Kunden sowie unsere eigenen Fragen in natürlicher Sprache stellen und vertrauenswürdige, governed Antworten erhalten können.

Wir haben verschiedene Ansätze evaluiert. Was für uns mit großem Abstand am besten funktionierte, waren Databricks Genie Agents, bereitgestellt als verwaltete MCP-Server, die mit einem MCP-Proxy-Layer zu domänenspezifischen Bundles zusammengestellt wurden.

In diesem Beitrag erfahren Sie:

  • Wie unsere Fachexperten (SMEs) zielgerichtete Genie Agents kuratieren – einen pro Datensatzgruppe innerhalb jedes Rohstoffs – ohne eine einzige Zeile Agent-Code zu schreiben.
  • Wie jeder Genie Agent automatisch zu einem governed MCP-Server wird, der direkt in jeden MCP-kompatiblen Client oder Agent integriert werden kann.
  • Wie wir einen FastMCP-basierten Proxy verwenden, um mehrere Genie MCP-Server zu zusammengesetzten Endpunkten für domänenübergreifende Fragen zu kombinieren.
  • Warum diese Architektur unsere Markteinführungszeit für AI-gestützte Datenprodukte drastisch verkürzt hat.
Mit Genie Agents können unsere Fachexperten ihr Datenwissen direkt in Produkte umsetzen. Was früher einen kompletten Entwicklungszyklus in Anspruch nahm, dauert heute nur noch wenige Tage, und jede Antwort bleibt innerhalb unserer Governance-Grenzen. —Priyanka John, Vice President, S&P Global Energy

Die Herausforderung: Strukturierte Daten sind leicht zu speichern, aber schwer zu befragen

Große Sprachmodelle sind bemerkenswert gut im Führen von Gesprächen und im logischen Denken, aber sie können keine Fragen zu Ihren Daten beantworten, es sei denn, Sie bauen eine Brücke dorthin. Für strukturierte Unternehmensdaten bedeutete diese Brücke in der Vergangenheit meist eine der folgenden Optionen:

  1. Manuell erstellte Text-to-SQL-Pipelines – leistungsstark, aber anfällig. Jede Schemaänderung, jeder mehrdeutige Spaltenname, jede domänenspezifische Metrikdefinition („Was zählt als Ausfalltag?“) wird zu einer Aufgabe für die Entwicklung.
  2. Benutzerdefinierte APIs pro Anwendungsfall – jedes neue Fragemuster erfordert einen neuen Endpunkt, einen neuen Sprint, ein neues Release.
  3. Exportieren von Daten in externe AI-Tools – was zu Datenduplizierung führt, die Aktualität beeinträchtigt und die Grenzen Ihrer Governance verletzt.

Jeder dieser Ansätze teilt dasselbe Problem: Die Personen, die die Daten am besten verstehen – unsere SMEs und Analysten –, sind nicht diejenigen, die die Zugriffsebene erstellen. Jede Erkenntnis musste erst ein Entwicklungs-Backlog durchlaufen. Unsere Markteinführungszeit für ein neues interaktives Datenerlebnis wurde in Monaten gemessen.

Wir brauchten einen ansatz, bei dem Fachexperten den interaktiven Zugriff auf Daten direkt kuratieren und veröffentlichen können, die Entwicklung die Anbindung von Agents standardisieren kann und die Governance zentralisiert bleibt. Genau das haben uns Genie Agents und MCP ermöglicht.

Die Architektur: Genie Agents als semantische Schicht, MCP als Vertrag

 Referenzarchitektur

Unsere Architektur besteht aus drei Schichten, und jede Schicht liegt in der Verantwortung der Personen, die am besten dafür geeignet sind. Das obige Diagramm zeigt den End-to-End-Ablauf – einschließlich dessen, was sich im Netzwerk von S&P Global Energy und was sich in der externen Client-Umgebung befindet.

Schicht 1: SMEs kuratieren einen Genie Agent pro Datensatzgruppe

Hier beginnt die Magie, und bemerkenswerterweise ist dafür kein Code erforderlich.

Unsere SMEs wählen zunächst die für einen Geschäftsbereich relevanten Tabellen aus:

  • Wenn die Tabellen bereits in Databricks liegen, nutzen sie diese direkt über Unity Catalog.
  • Wenn die Daten in einer Nicht-Databricks-Quelle liegen, binden sie diese über Lakehouse Federation-Konnektoren ein – ohne Datenbewegung, ohne doppelte Pipelines. Die föderierten Tabellen erscheinen neben nativen Tabellen und übernehmen dieselbe Governance.

Anschließend gruppieren sie zusammengehörige Tabellen und erstellen einen Genie Agent pro Datensatzgruppe – nicht einen riesigen Agent pro Rohstoff. Jede Unterkategorie eines Rohstoffs wird zu einem eigenen, fokussierten Genie Agent. Bei LNG zum Beispiel:

  • LNG Assets & Contracts Genie Agent – Anlagen, Betreiber, Kapazitätsprognosen und langfristige Verträge
  • LNG Cargo Genie Agent – Ladungsverfolgung, Abschlüsse, Herkunft/Ziele und kommerzielle Bedingungen
  • LNG Tenders Genie Agent  – Ausschreibungen mit Emittenten, Volumina und Lieferfenstern
  • LNG Outages Genie Agent – Ausfälle und Wartungsereignisse mit Kapazitätsauswirkungen
  • LNG Supply & Demand Genie Agent – Fundamentaldaten mit regionaler Aufteilung und Szenariohistorie
  • LNG Netbacks Genie Agent – Netbacks aus Hub-Preisen, Fracht, Boil-off und Verlusten
  • LNG Prices Genie Agent – historische und prognostizierte Preiskurven

Jeder andere Rohstoff folgt demselben Muster mit eigenen Unterkategorien. Chemikalien verfügt beispielsweise über Genie Agents auf Gruppenebene für Kapazität, Produktion, Kapazitätsauslastung, Handel, Nachfrage nach Endverwendung und Derivaten, Bestandsveränderungen sowie Angebots-Nachfrage-Bilanzen auf Länder- und Regionalebene; Rohöl, raffinierte Produkte sowie Gas & Strom sind ähnlich organisiert. Das Ergebnis ist eine Flotte kleiner, präzise zugeschnittener Genie Agents anstelle einer Handvoll unübersichtlicher, voneinander isolierter AI-Tools.

Innerhalb jedes Agents fügen SMEs den Kontext hinzu, der Text-to-SQL in der Praxis überhaupt erst funktionsfähig macht: Beschreibungen von Tabellen und Spalten, Beispielabfragen, vertrauenswürdige Assets für kritische Kennzahlen und geschäftliche Definitionen (z. B. „Floating Storage ist definiert als Ladungen, die 3 Tage oder länger auf Schiffen liegen, die sich unterhalb einer bestimmten Schwellenwertgeschwindigkeit bewegen“). Dies ist der Schritt, den generische Text-to-SQL-Lösungen überspringen – und es ist der Schritt, der darüber entscheidet, ob Benutzer den Antworten vertrauen.

Die wichtigste organisatorische Erkenntnis: Die Kuration wurde zu einer Fachbereichsaufgabe, nicht zu einer Engineering-Aufgabe. Die Person, die weiß, was „schwimmende Lagerung“ im LNG-Kontext bedeutet, bringt dies auch Genie bei.

Ebene 2: Jeder Genie-Agent ist automatisch ein MCP-Server

Hier hat Databricks die Schwerstarbeit für uns übernommen. Jeder Genie-Agent wird standardmäßig als von Databricks verwalteter MCP-Server bereitgestellt, und zwar an einem Endpunkt im folgenden Format:

https://<workspace-hostname>/api/2.0/mcp/genie/{genie_space_id}

Es muss nichts bereitgestellt und nichts gehostet werden. Jeder Server bietet eine kleine, übersichtliche Tool-Oberfläche – im Wesentlichen zwei Tools pro Agent:

  1. Ein Abfragetool (genie_query_space) – der Agent übermittelt eine Frage in natürlicher Sprache an den Agenten.
  2. Ein Antworttool (genie_poll_response) – der Agent fragt mit derselben Konversations- und Nachrichten-ID ab, um die vollständige Antwort abzurufen, sobald sie bereit ist, einschließlich des generierten SQL und der Ergebnismenge.


Dieses aus zwei Tools bestehende „Ask-then-Poll“-Muster eignet sich hervorragend für agentische Workloads: Fragen werden asynchron an ein SQL-Warehouse gerichtet, und der Agent fragt so lange mit der vom Abfragetool zurückgegebenen Konversations- und Nachrichten-ID ab, bis die Antwort bereit ist.

Ebenso wichtig ist, dass diese verwalteten Server durch Unity Catalog gesteuert werden. Ein Genie-Agent – oder der Benutzer dahinter – kann nur auf die Agenten und zugrunde liegenden Tabellen zugreifen, für die er eine Berechtigung besitzt. Die Authentifizierung wird von der Plattform übernommen. Wir mussten keine eigene Sicherheitsebene für unseren KI-Zugriff aufbauen, sondern haben die bereits vorhandene übernommen.

Ebene 3: Zusammenführen von Gruppen-Genie-Agenten zu Rohstoff-Bundles mit einem FastMCP-Proxy

Ein Genie-Agent pro Datensatzgruppe sorgt dafür, dass jeder Agent fokussiert und präzise bleibt. Reale geschäftliche Fragen betreffen jedoch routinemäßig mehrere Gruppen: „Wie haben sich die jüngsten Ausfälle bei Sabine Pass auf die Frachtprämien nach Asien ausgewirkt?“ betrifft sowohl den Ausfall- als auch den Fracht-Genie-Agenten gleichzeitig. Und rohstoffübergreifende Fragen wie „Wie beeinflussen die Naphtha-Preise die Margen der Chemieproduktion?“ greifen sowohl auf Genie-Agenten für raffinierte Produkte als auch für Chemikalien zu.

Anstatt einen einzigen riesigen Agenten zu erstellen (was die Antwortqualität verschlechtert) oder jeden Client zu zwingen, ein Dutzend separate Server zu konfigurieren, haben wir die Proxy- und Kompositionsfunktionen von FastMCP genutzt, um zusammengesetzte MCP-Endpunkte zu erstellen. Typischerweise gibt es einen pro Rohstoff, der die Genie-MCP-Server dieses Rohstoffs auf Gruppenebene hinter einem einzigen Server mit Tools in eigenen Namensräumen bereitstellt. Höherwertige zusammengesetzte Endpunkte können mehrere Rohstoffe auf dieselbe Weise bündeln:

from fastmcp import FastMCP

# Each group-level Genie Agent is a managed MCP server on Databricks 
cargo = FastMCP.as_proxy(genie_mcp_config(“lng_cargo_agent_id”), name=“cargo”) 
outages = FastMCP.as_proxy(genie_mcp_config(“lng_outages_agent_id”), name=“outages”) 
netbacks = FastMCP.as_proxy(genie_mcp_config(“lng_netbacks_agent_id”), name=“netbacks”) 

# Compose the group Genies into one commodity bundle 
lng = FastMCP(name=“lng-composite”) 
lng.mount(cargo, prefix=“cargo”)
lng.mount(outages, prefix=“outages”)
lng.mount(netbacks, prefix=“netbacks”) 

# The same pattern repeats for Chemicals, Crude Oil, Refined Products, Coal …

(Illustrierendes Snippet – passen Sie es an Ihre FastMCP-Version und Ihr Authentifizierungs-Setup an.)

Das Ergebnis: Ein Agent verbindet sich mit einem zusammengesetzten Endpunkt pro Rohstoff und sieht ein kuratiertes Set von Gruppentools – cargo_genie_query_agent, outages_genie_query_agent, netbacks_genie_query_agent usw., jeweils gepaart mit dem entsprechenden genie_poll_response-Gegenstück. Das LLM des Agenten entscheidet, an welches Gruppen-Genie eine Frage weitergeleitet werden soll, oder verteilt eine gruppenübergreifende Frage auf mehrere und führt die Ergebnisse anschließend zusammen.

Damit erhielten wir das Beste aus beiden Welten: spezialisierte, hochpräzise Genie-Agenten auf Gruppenebene im Hintergrund und einen umfassenden, rohstoff- und datenbestandsweiten dialogbasierten Zugriff im Vordergrund.

Was sich für das Unternehmen geändert hat

Für unsere geschäftlichen Stakeholder bedeuten diese technischen Details einige sehr konkrete Ergebnisse.

Die Time-to-Market ist drastisch geschrumpft. Zuvor bedeutete die Bereitstellung einer neuen dialogbasierten Datenerfahrung einen vollständigen Entwicklungszyklus: Anforderungen, API-Design, Text-to-SQL-Engineering, Tests, Deployment. Mit dieser Architektur bedeutet die Einführung einer neuen Datensatzgruppe – oder eines gesamten Rohstoffs –, dass ein SME die entsprechenden Genie-Agenten erstellt und kuratiert – der MCP-Endpunkt existiert in dem Moment, in dem der Agent erstellt wird.

SMEs wurden zu Publishern statt zu Anforderern. Die Fachexperten, die sich mit LNG-Frachten oder dem Gleichgewicht von Angebot und Nachfrage bei Chemikalien auskennen, müssen keine Tickets mehr erstellen, um ihre Daten freizugeben. Sie kuratieren einfach einen Genie-Agenten, und dieser ist sofort einsatzbereit. Der Engineering-Aufwand verlagerte sich vom Erstellen maßgeschneiderter Zugriffsebenen auf die Wartung einer einzigen schlanken, wiederverwendbaren Proxy-Ebene.

Governance ist direkt integriert. Jede Frage, die ein Agent stellt, durchläuft die Berechtigungsprüfungen von Unity Catalog auf kontrollierten Tabellen (nativ oder föderiert) und ist vollständig prüfbar. Daten für KI verfügbar zu machen, bedeutete nicht, sie außerhalb unserer Kontrollmechanismen bereitzustellen.

Ein Integrationsmuster, viele Konsumenten – innerhalb und außerhalb des Unternehmens. Da MCP ein offener Standard ist, bedienen dieselben zusammengesetzten Endpunkte unsere internen Agenten, unsere kundenorientierten KI-Anwendungen und – was besonders wichtig ist – unsere externen Kunden, die ihre eigenen MCP-kompatiblen Agenten und Assistenten direkt mit den kontrollierten Daten von S&P Global Energy verbinden können. Wir haben die Brücke einmal gebaut; jeder interne oder externe MCP-Client kann sie nutzen.

Die Antwortqualität ist messbar und bleibt es auch. In einem Bereich, in dem Preis-, Liefer- und Vertragsdaten reale Entscheidungen beeinflussen, müssen sich die Nutzer auf jede Antwort und Berechnung verlassen können. Genie-Agenten-Benchmarks bieten unseren SMEs eine integrierte Möglichkeit, Testfragen zu definieren, die der tatsächlichen Fragestellung der Nutzer entsprechen (einschließlich mehrerer Formulierungen derselben Frage), und die Genauigkeit des Agenten automatisch anhand verifizierter Antworten zu bewerten. Ebenso wichtig ist, dass Benchmarks nach jeder Anpassung von Anweisungen, Daten oder Geschäftslogik erneut ausgeführt werden können, sodass die Genauigkeit über die Zeit hinweg erhalten bleibt. Das Ergebnis ist ein effizienter, kontinuierlicher Qualitätskreislauf: Kuration, Benchmarking, Verbesserung und erneutes Benchmarking, um sicherzustellen, dass unsere Agenten präzise bleiben, während sich unsere Daten und die Fragen unserer Kunden weiterentwickeln.

Erkenntnisse und Best Practices

Einige praktische Erkenntnisse aus unserer Erfahrung für Teams, die einen ähnlichen Weg in Betracht ziehen:

  1. Halten Sie Genie-Agenten spezialisiert und gut kuratiert. Die Antwortqualität ist am höchsten, wenn ein Agent einen bestimmten Datenbereich mit klaren Anweisungen und Beispielabfragen abdeckt. Widerstehen Sie der Versuchung, einen Agenten pro Rohstoff zu erstellen – oder schlimmer noch, einen einzigen Agenten für alles. Führen Sie stattdessen mehrere Datenbereiche auf der MCP-Ebene zusammen.
  2. Nutzen Sie Lakehouse Federation, bevor Sie Pipelines erstellen. Bei Nicht-Databricks-Quellen hat uns die Föderation ohne einen einzigen neuen ETL-Job direkt zum dialogbasierten Zugriff geführt. Häufig genutzte Pfade können Sie später immer noch materialisieren.
  3. Investieren Sie in die semantische Ebene. Spaltenbeschreibungen, geschäftliche Definitionen und bewährte Beispielabfragen machen den Unterschied zwischen einer Demo und einem echten Produkt aus. Dies ist gut investierte Zeit für Ihre SMEs.
  4. Versehen Sie Ihre zusammengesetzten Tools mit klaren Namensräumen. Wenn ein Agent Tools von vielen Gruppen-Genies sieht, helfen Präfixe wie cargo_ und outages_ dem LLM, Fragen korrekt weiterzuleiten.
  5. Messen Sie Vertrauen, nicht nur Latenz. Wir haben erfasst, wie oft SMEs dem von Genie generierten SQL während der Kuration zugestimmt haben – das ist der beste Frühindikator dafür, ob die geschäftlichen Nutzer die Anwendung annehmen werden.

Fazit

Unser Ziel war es, unseren gesamten strukturierten Datenbestand – der LNG, Chemikalien, Rohöl, raffinierte Produkte, Gas und Strom und mehr umfasst – für KI-Agenten verfügbar zu machen: sicher, präzise und schnell. Mit Databricks Genie-Agenten als von SMEs kuratierter semantischer Ebene, verwalteten MCP-Servern als integrationsfertigem Standard ohne Bereitstellungsaufwand und einem FastMCP-Proxy für die domänenübergreifende Komposition haben wir genau das erreicht:

  • Geschwindigkeit: Neue dialogbasierte Datenbereiche gehen in Tagen statt in Entwicklungszyklen live – was unsere Time-to-Market massiv beschleunigt.
  • Genauigkeit: Auf bestimmte Domänen spezialisierte, von SME kuratierte Agenten liefern Antworten, denen geschäftliche Anwender wirklich vertrauen.
  • Governance: Unity Catalog sichert jede Anfrage ab – sowohl für native als auch für föderierte Daten, ohne dass ein paralleler Sicherheits-Stack gewartet werden muss.
  • Offenheit: Eine Brücke nach MCP-Standard bedient jeden aktuellen und zukünftigen Agenten, ob intern oder extern.

Der tiefere Wandel ist jedoch organisatorischer Natur: Die Personen, die die Daten verstehen, sind nun auch diejenigen, die den Zugriff darauf veröffentlichen. Das ist es, was unsere strukturierten Daten – mehr als jede einzelne Technologie – von etwas, das Benutzer abfragen, in etwas verwandelt hat, mit dem sie sich einfach unterhalten können.

(Dieser Blogbeitrag wurde mit KI-gestützten Tools übersetzt.) Originalbeitrag

Erhalten Sie die neuesten Beiträge in Ihrem Posteingang

Abonnieren Sie unseren Blog und erhalten Sie die neuesten Beiträge direkt in Ihren Posteingang.