Configurez une connexion S3 sécurisée vers Databricks en quelques minutes grâce à un nouveau flux de création d'emplacements externes
par Gordon Wang
La connexion à Amazon S3 est l'une des étapes de configuration les plus importantes pour tirer parti de Databricks. Les emplacements externes (external locations) fournissent la connexion gouvernée entre votre compartiment S3 et Unity Catalog afin que Databricks puisse lire et écrire des données en toute sécurité. Cette configuration est fondamentale pour les workflows courants, de l'ingestion et des pipelines à l'analyse et à la gouvernance. Elle est également de plus en plus importante à mesure que de plus en plus d'utilisateurs adoptent l'LTAP (Lake Transactional/Analytical Processing), une nouvelle architecture conçue pour unifier les données transactionnelles et analytiques sur une base gouvernée unique, sans la complexité traditionnelle des pipelines, des réplicas et de l'ETL.
Aujourd'hui, les clients autorisent la connectivité S3 en créant un emplacement externe, un objet Unity Catalog qui associe un chemin de stockage à un identifiant de stockage (storage credential) pour autoriser l'accès en lecture et en écriture à votre compartiment S3.

Jusqu'à présent, la connexion à S3 était souvent l'une des étapes les plus fastidieuses pour démarrer sur Databricks. La configuration automatique permet aux clients de passer moins de temps à gérer l'infrastructure cloud et plus de temps à développer l'intelligence des données (data intelligence) à partir de leurs données.
La connexion d'un compartiment Amazon S3 à Databricks nécessite la création d'un emplacement externe, une connexion enregistrée dans Unity Catalog qui régit la manière dont Databricks lit et écrit vos données. Auparavant, cela nécessitait de rédiger des politiques de confiance IAM de 140 lignes, de configurer les autorisations des compartiments S3, de déployer des modèles CloudFormation et de basculer entre la console AWS et Databricks pour tout enregistrer correctement.
Désormais, nous avons simplifié ce processus en quelques clics :

Ce nouveau flux est alimenté par la délégation temporaire AWS IAM. Après avoir spécifié votre compartiment S3 et votre niveau d'accès, vous êtes invité à vous connecter à AWS pour vérifier vos autorisations. Si vous disposez d'un accès suffisant, vous pouvez accorder à Databricks une autorisation temporaire et limitée dans le temps pour provisionner les ressources requises en votre nom. Les utilisateurs qui ne disposent pas d'autorisations AWS suffisantes peuvent les demander directement à leur administrateur AWS au cours du processus.
Une fois cette délégation en place, Databricks gère automatiquement le reste :
Le travail de configuration manuelle qui s'effectuait auparavant sur plusieurs consoles se déroule désormais au cours d'une seule session, de manière native depuis l'espace de travail Databricks. Le provisionnement automatisé élimine les modes de défaillance les plus courants, tels que les politiques de confiance incorrectes, les autorisations de compartiment manquantes ou les ARN mal configurés, tout en garantissant que chaque rôle IAM créé respecte les principes du moindre privilège, conformément aux normes de sécurité de l'entreprise.
À mesure que de plus en plus d'utilisateurs adoptent l'architecture LTAP, une connectivité S3 simplifiée élimine un obstacle majeur au niveau de l'infrastructure en fournissant une destination de stockage cloud gouvernée où les données opérationnelles peuvent être interrogées instantanément par des moteurs d'analyse, sans nécessiter de pipelines distincts.
Dans votre espace de travail, accédez à Catalog Explorer → External Locations → Create (/explore/locations/create) pour connecter automatiquement votre compartiment S3 grâce à la configuration automatique.
Pour plus d'informations :
(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original
Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.