Accedi e gestisci tutti i tuoi dati S3 utilizzando Unity Catalog all'interno di un ambiente Azure Databricks sicuro
di Paul Roome, Kelly Albano e Jeff Chen
Siamo entusiasti di annunciare che la possibilità di accedere ai dati AWS S3 su Azure Databricks tramite Unity Catalog per abilitare la data governance cross-cloud è ora disponibile a livello generale. In quanto unica soluzione di governance unificata e aperta del settore per tutti gli asset di dati e IA, Unity Catalog consente alle organizzazioni di gestire i dati ovunque si trovino, garantendo sicurezza, conformità e interoperabilità tra i cloud. Con questa release, i team possono configurare e interrogare direttamente i dati AWS S3 da Azure Databricks senza dover migrare o copiare i dataset. Ciò semplifica la standardizzazione di policy, controlli di accesso e auditing sia sullo storage ADLS che su S3.
In questo blog parleremo di due argomenti chiave:
Man mano che le aziende adottano architetture ibride e cross-cloud, si trovano spesso ad affrontare controlli di accesso frammentati, policy di sicurezza incoerenti e processi di governance duplicati. Questa complessità aumenta i rischi, fa lievitare i costi operativi e rallenta l'innovazione.
La data governance cross-cloud con Unity Catalog semplifica tutto questo estendendo un unico modello di autorizzazione, l'applicazione centralizzata delle policy e un auditing completo su tutti i dati archiviati in più cloud, come AWS S3 e Azure Data Lake Storage, il tutto gestito all'interno della piattaforma Databricks.
I principali vantaggi derivanti dall'utilizzo della data governance cross-cloud su Unity Catalog includono:
Collegando la governance tra i diversi cloud, Unity Catalog offre ai team un'unica interfaccia sicura per gestire e massimizzare il valore di tutti i loro asset di dati e IA, ovunque si trovino.
In precedenza, quando si utilizzava Azure Databricks, Unity Catalog supportava solo posizioni di archiviazione all'interno di ADLS. Ciò significava che, se avevi dati archiviati in un bucket AWS S3 ma avevi bisogno di accedervi ed elaborarli con Unity Catalog su Azure Databricks, l'approccio tradizionale richiedeva l'estrazione, la trasformazione e il caricamento (ETL) di tali dati in un container ADLS: un processo costoso e dispendioso in termini di tempo. Questo aumentava anche il rischio di mantenere copie duplicate e non aggiornate dei dati.
Con questa release GA, ora puoi configurare una posizione S3 esterna cross-cloud direttamente da Unity Catalog su Azure Databricks. Ciò ti consente di leggere e gestire i tuoi dati S3 in modo trasparente, senza migrazioni o duplicazioni.

Puoi configurare l'accesso al tuo bucket AWS S3 in pochi semplici passaggi:



3. Inizia a eseguire query! Ora puoi interrogare i tuoi dati S3 direttamente dal tuo workspace Azure Databricks.

Con la GA, ora supportiamo l'accesso a tabelle e volumi esterni in S3 da Azure Databricks. Nello specifico, le seguenti funzionalità sono ora supportate in modalità di sola lettura:
Per provare la data governance cross-cloud su Azure Databricks, consulta la nostra documentazione su come configurare le credenziali di archiviazione per i ruoli IAM per lo storage S3 su Azure Databricks. È importante notare che il tuo cloud provider potrebbe addebitare tariffe per l'accesso a dati esterni ai suoi servizi cloud. Per iniziare a usare Unity Catalog, segui la nostra guida di Unity Catalog per Azure.
Unisciti al team di prodotto e ingegneria di Unity Catalog al Data + AI Summit, dal 9 al 12 giugno al Moscone Center di San Francisco! Scopri in anteprima le ultime innovazioni nella governance dei dati e dell'IA. Registrati ora per assicurarti un posto!
(Questo post sul blog è stato tradotto utilizzando strumenti basati sull'intelligenza artificiale) Post originale
Iscriviti al nostro blog e ricevi gli ultimi articoli direttamente nella tua casella di posta.