Revenir au contenu principal
Produit

Connectez les données Amazon S3 à Databricks avec des autorisations IAM déléguées

Configurez une connexion S3 sécurisée vers Databricks en quelques minutes grâce à un nouveau flux de création d'emplacements externes

par Gordon Wang

  • Pourquoi une connectivité S3 simplifiée est importante
  • Comment fonctionne la délégation temporaire AWS IAM pour S3
  • Comment configurer un emplacement externe avec le nouveau flux

Importance d'une connectivité S3 simplifiée

La connexion à Amazon S3 est l'une des étapes de configuration les plus importantes pour tirer parti de Databricks. Les emplacements externes (external locations) fournissent la connexion gouvernée entre votre compartiment S3 et Unity Catalog afin que Databricks puisse lire et écrire des données en toute sécurité. Cette configuration est fondamentale pour les workflows courants, de l'ingestion et des pipelines à l'analyse et à la gouvernance. Elle est également de plus en plus importante à mesure que de plus en plus d'utilisateurs adoptent l'LTAP (Lake Transactional/Analytical Processing), une nouvelle architecture conçue pour unifier les données transactionnelles et analytiques sur une base gouvernée unique, sans la complexité traditionnelle des pipelines, des réplicas et de l'ETL.

Aujourd'hui, les clients autorisent la connectivité S3 en créant un emplacement externe, un objet Unity Catalog qui associe un chemin de stockage à un identifiant de stockage (storage credential) pour autoriser l'accès en lecture et en écriture à votre compartiment S3.

image1.png

Jusqu'à présent, la connexion à S3 était souvent l'une des étapes les plus fastidieuses pour démarrer sur Databricks. La configuration automatique permet aux clients de passer moins de temps à gérer l'infrastructure cloud et plus de temps à développer l'intelligence des données (data intelligence) à partir de leurs données.

Comment fonctionne la connectivité S3 automatisée

La connexion d'un compartiment Amazon S3 à Databricks nécessite la création d'un emplacement externe, une connexion enregistrée dans Unity Catalog qui régit la manière dont Databricks lit et écrit vos données. Auparavant, cela nécessitait de rédiger des politiques de confiance IAM de 140 lignes, de configurer les autorisations des compartiments S3, de déployer des modèles CloudFormation et de basculer entre la console AWS et Databricks pour tout enregistrer correctement.

Désormais, nous avons simplifié ce processus en quelques clics :

image2.gif

Que se passe-t-il en coulisses ?

Ce nouveau flux est alimenté par la délégation temporaire AWS IAM. Après avoir spécifié votre compartiment S3 et votre niveau d'accès, vous êtes invité à vous connecter à AWS pour vérifier vos autorisations. Si vous disposez d'un accès suffisant, vous pouvez accorder à Databricks une autorisation temporaire et limitée dans le temps pour provisionner les ressources requises en votre nom. Les utilisateurs qui ne disposent pas d'autorisations AWS suffisantes peuvent les demander directement à leur administrateur AWS au cours du processus.

Une fois cette délégation en place, Databricks gère automatiquement le reste :

  • Identifiant de stockage (storage credential) : un rôle IAM avec des autorisations de moindre privilège est créé et la politique de confiance multicompte est correctement configurée.
  • Emplacement externe (external location) : un emplacement externe entièrement configuré et enregistré dans Unity Catalog, mappé sur le compartiment spécifié. Auto Loader et File Events sont activés automatiquement.
    Une fois la configuration terminée, l'autorisation expire automatiquement. Databricks ne conserve jamais d'accès permanent à votre compte AWS, et toutes les actions effectuées lors du provisionnement sont enregistrées dans AWS CloudTrail.

Ce que cela signifie en pratique

Le travail de configuration manuelle qui s'effectuait auparavant sur plusieurs consoles se déroule désormais au cours d'une seule session, de manière native depuis l'espace de travail Databricks. Le provisionnement automatisé élimine les modes de défaillance les plus courants, tels que les politiques de confiance incorrectes, les autorisations de compartiment manquantes ou les ARN mal configurés, tout en garantissant que chaque rôle IAM créé respecte les principes du moindre privilège, conformément aux normes de sécurité de l'entreprise.

À mesure que de plus en plus d'utilisateurs adoptent l'architecture LTAP, une connectivité S3 simplifiée élimine un obstacle majeur au niveau de l'infrastructure en fournissant une destination de stockage cloud gouvernée où les données opérationnelles peuvent être interrogées instantanément par des moteurs d'analyse, sans nécessiter de pipelines distincts.

En savoir plus

Dans votre espace de travail, accédez à Catalog Explorer → External Locations → Create (/explore/locations/create) pour connecter automatiquement votre compartiment S3 grâce à la configuration automatique.

Pour plus d'informations :

(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original

Recevez les derniers articles dans votre boîte mail

Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.