Direkt zum Hauptinhalt
Produkt

Ankündigung der allgemeinen Verfügbarkeit von Cloud-übergreifender Data Governance

Greifen Sie mit Unity Catalog in einer sicheren Azure Databricks-Umgebung auf all Ihre S3-Daten zu und verwalten Sie diese

von Paul Roome, Kelly Albano und Jeff Chen

  • Unity Catalog auf Azure Databricks unterstützt jetzt den direkten Zugriff auf AWS S3-Daten, sodass Sie Zugriffskontrollen, Richtlinien und Audits für S3 und ADLS vereinheitlichen können.
  • Teams können S3-Daten jetzt direkt in Azure Databricks konfigurieren und abfragen, ohne Daten migrieren oder duplizieren zu müssen.
  • Das Release zur allgemeinen Verfügbarkeit (GA) unterstützt schreibgeschützte Funktionen wie externe S3-Tabellen, Volumes und AWS IAM-basierte Anmeldeinformationen in Azure Databricks.

Wir freuen uns, anzukündigen, dass die Möglichkeit, über Unity Catalog auf AWS S3-Daten in Azure Databricks zuzugreifen, um eine Cloud-übergreifende Data Governance zu ermöglichen, ab sofort allgemein verfügbar (GA) ist. Als branchenweit einzige einheitliche und offene Governance-Lösung für alle Daten- und KI-Assets ermöglicht Unity Catalog es Unternehmen, Daten dort zu verwalten, wo sie sich befinden, und sorgt so für Sicherheit, Compliance und Interoperabilität über verschiedene Clouds hinweg. Mit diesem Release können Teams AWS S3-Daten direkt in Azure Databricks konfigurieren und abfragen, ohne Datensätze migrieren oder kopieren zu müssen. Dies erleichtert die Standardisierung von Richtlinien, Zugriffskontrollen und Audits sowohl für ADLS- als auch für S3-Speicher.

In diesem Blog behandeln wir zwei Hauptthemen:

  • Wie Unity Catalog eine Cloud-übergreifende Data Governance ermöglicht
  • Wie Sie von Azure Databricks aus auf AWS S3-Daten zugreifen und damit arbeiten

Was ist Cloud-übergreifende Data Governance in Unity Catalog?

Da Unternehmen zunehmend hybride und Cloud-übergreifende Architekturen einführen, stehen sie häufig vor fragmentierten Zugriffskontrollen, inkonsistenten Sicherheitsrichtlinien und doppelten Governance-Prozessen. Diese Komplexität erhöht das Risiko, treibt die Betriebskosten in die Höhe und bremst Innovationen.

Die Cloud-übergreifende Data Governance mit Unity Catalog vereinfacht dies, indem sie ein einziges Berechtigungsmodell, eine zentrale Richtliniendurchsetzung und eine umfassende Überwachung für Daten in mehreren Clouds wie AWS S3 und Azure Data Lake Storage bereitstellt – alles verwaltet direkt aus der Databricks-Plattform heraus.

Zu den Hauptvorteilen der Cloud-übergreifenden Data Governance mit Unity Catalog gehören:

  • Einheitliche Governance – Verwalten Sie Zugriffsrichtlinien, Sicherheitskontrollen und Compliance-Standards an einem zentralen Ort, ohne isolierte Systeme koordinieren zu müssen
  • Reibungsloser Datenzugriff – Suchen, fragen und analysieren Sie Daten sicher über verschiedene Clouds hinweg in einem einzigen Arbeitsbereich, wodurch Datensilos vermieden und die Komplexität reduziert werden
  • Höhere Sicherheit und Compliance – Profitieren Sie von zentraler Transparenz, Tagging, Lineage, Datenklassifizierung und Audits für Ihren gesamten Cloud-Speicher

Durch die Verknüpfung der Governance über verschiedene Clouds hinweg bietet Unity Catalog Teams eine einzige, sichere Schnittstelle zur Verwaltung und Wertmaximierung all ihrer Daten- und KI-Assets – unabhängig davon, wo sie sich befinden.

So funktioniert es

Bisher unterstützte Unity Catalog bei der Verwendung von Azure Databricks nur Speicherorte innerhalb von ADLS. Wenn Sie Daten in einem AWS S3-Bucket gespeichert hatten, aber mit Unity Catalog in Azure Databricks darauf zugreifen und diese verarbeiten wollten, mussten Sie diese Daten im klassischen Ansatz extrahieren, transformieren und laden (ETL) und in einen ADLS-Container übertragen – ein Prozess, der sowohl kostspielig als auch zeitaufwendig ist. Zudem erhöht sich dadurch das Risiko, doppelte und veraltete Datenkopien zu verwalten.

Mit diesem GA-Release können Sie nun direkt in Unity Catalog auf Azure Databricks einen externen, Cloud-übergreifenden S3-Speicherort einrichten. Dadurch können Sie Ihre S3-Daten nahtlos lesen und verwalten, ohne sie migrieren oder duplizieren zu müssen.

Diagramm zur Cloud-übergreifenden Data Governance

Sie können den Zugriff auf Ihren AWS S3-Bucket in wenigen einfachen Schritten konfigurieren:

  1. Richten Sie Ihre Speicher-Anmeldeinformationen ein und erstellen Sie einen externen Speicherort. Sobald Ihre AWS IAM- und S3-Ressourcen bereitgestellt sind, können Sie Ihre Speicher-Anmeldeinformationen und den externen Speicherort direkt im Azure Databricks Catalog Explorer erstellen.
    • Um Ihre Speicher-Anmeldeinformationen zu erstellen, navigieren Sie im Catalog Explorer zu Credentials. Wählen Sie „AWS IAM Role (Read-only)“, füllen Sie die erforderlichen Felder aus und fügen Sie das Trust-Policy-Snippet hinzu, wenn Sie dazu aufgefordert werden.​UI zum Erstellen neuer Anmeldeinformationen
    • Um einen externen Speicherort zu erstellen, navigieren Sie im Catalog Explorer zu External locations. Wählen Sie dann die soeben eingerichteten Anmeldeinformationen aus und ergänzen Sie die restlichen Angaben. Ein Screenshot eines Databricks-Notebooks, das eine Bilddatei anzeigt.
  2. Berechtigungen anwenden. Auf der Seite „Credentials“ im Catalog Explorer sehen Sie nun Ihre ADLS- und S3-Daten zusammen an einem Ort in Azure Databricks. Von dort aus können Sie konsistente Berechtigungen für beide Speichersysteme anwenden.
Ein GIF-Bild zum Anwenden von Berechtigungen

3. Abfragen starten! Sie können Ihre S3-Daten nun direkt aus Ihrem Azure Databricks-Arbeitsbereich abfragen.

Ein Bild einer Databricks-Notebook-Benutzeroberfläche, das eine Datenvisualisierung anzeigt.

Was wird im GA-Release unterstützt?

Mit der allgemeinen Verfügbarkeit (GA) unterstützen wir jetzt den Zugriff auf externe Tabellen und Volumes in S3 von Azure Databricks aus. Konkret werden die folgenden Funktionen im schreibgeschützten Modus unterstützt:

  • AWS IAM-Rollen-Speicheranmeldeinformationen
  • Externe S3-Speicherorte
  • Externe S3-Tabellen
  • Externe S3-Volumes
  • S3-Zugriff über dbutils.fs
  • Delta Sharing von S3-Daten aus UC auf Azure

Erste Schritte

Um die Cloud-übergreifende Data Governance auf Azure Databricks auszuprobieren, lesen Sie unsere Dokumentation zur Einrichtung von Speicher-Anmeldeinformationen für IAM-Rollen für den S3-Speicher auf Azure Databricks. Bitte beachten Sie, dass Ihr Cloud-Anbieter Gebühren für den Zugriff auf Daten außerhalb seiner Cloud-Dienste erheben kann. Um mit Unity Catalog zu beginnen, folgen Sie unserem Unity Catalog-Leitfaden für Azure.

Treffen Sie das Produkt- und Entwicklungsteam von Unity Catalog auf dem Data + AI Summit vom 9. bis 12. Juni im Moscone Center in San Francisco! Erhalten Sie einen ersten Einblick in die neuesten Innovationen im Bereich Daten- und KI-Governance. Registrieren Sie sich jetzt, um sich Ihren Platz zu sichern!

(Dieser Blogbeitrag wurde mit KI-gestützten Tools übersetzt.) Originalbeitrag

Erhalten Sie die neuesten Beiträge in Ihrem Posteingang

Abonnieren Sie unseren Blog und erhalten Sie die neuesten Beiträge direkt in Ihren Posteingang.