Ir al contenido principal
Producto

Conecta datos de Amazon S3 a Databricks con permisos de IAM delegados

Configura una conexión segura de S3 a Databricks en cuestión de minutos con un nuevo flujo de creación de ubicaciones externas

por Gordon Wang

  • Por qué es importante una conectividad de S3 más sencilla
  • Cómo funciona la delegación temporal de AWS IAM para S3
  • Cómo configurar una ubicación externa con el nuevo flujo

Importancia de una conectividad de S3 más sencilla

Conectar Amazon S3 es uno de los pasos de configuración más importantes para obtener valor de Databricks. Las ubicaciones externas proporcionan la conexión gobernada entre tu bucket de S3 y Unity Catalog para que Databricks pueda leer y escribir datos de forma segura. Esta configuración es fundamental para los flujos de trabajo comunes, desde la ingesta y las canalizaciones (pipelines) hasta la analítica y el gobierno de datos. También es cada vez más importante a medida que más personas adoptan LTAP (Lake Transactional/Analytical Processing), una nueva arquitectura diseñada para unificar datos transaccionales y analíticos en una única base gobernada sin la sobrecarga tradicional de pipelines, réplicas y ETL.

Hoy en día, los clientes autorizan la conectividad de S3 creando una ubicación externa, un objeto de Unity Catalog que combina una ruta de almacenamiento con una credencial de almacenamiento para autorizar el acceso de lectura y escritura a tu bucket de S3.

image1.png

Hasta ahora, conectarse a S3 solía ser una de las partes más complejas al comenzar a usar Databricks. La configuración automática ayuda a los clientes a dedicar menos tiempo a administrar la infraestructura de la nube y más tiempo a crear inteligencia de datos sobre sus propios datos.

Cómo funciona la conectividad automatizada de S3

Conectar un bucket de Amazon S3 a Databricks requiere crear una ubicación externa, una conexión registrada en Unity Catalog que gobierna cómo Databricks lee y escribe tus datos. Anteriormente, eso significaba redactar políticas de confianza de IAM de 140 líneas, configurar permisos de buckets de S3, implementar plantillas de CloudFormation y alternar entre la consola de AWS y Databricks para registrar todo correctamente.

Ahora, lo hemos simplificado a unos pocos clics:

image2.gif

¿Qué ocurre internamente?

Este nuevo flujo funciona mediante la delegación temporal de AWS IAM. Después de especificar tu bucket de S3 y el nivel de acceso, se te pedirá que inicies sesión en AWS para verificar tus permisos. Si tienes el acceso suficiente, podrás otorgar a Databricks una autorización temporal y limitada en el tiempo para aprovisionar los recursos necesarios en tu nombre. Aquellos usuarios que no tengan suficientes permisos de AWS pueden solicitarlos directamente a su administrador de AWS dentro del mismo flujo.

Con esa delegación establecida, Databricks se encarga automáticamente del resto:

  • Credencial de almacenamiento: se crea un rol de IAM con permisos de mínimo privilegio y la política de confianza entre cuentas se configura correctamente.
  • Ubicación externa: una ubicación externa completamente configurada y registrada en Unity Catalog, asignada a tu bucket especificado. Auto Loader y File Events se habilitan automáticamente.
    Una vez completada la configuración, la autorización expira automáticamente. Databricks nunca mantiene un acceso permanente a tu cuenta de AWS, y todas las acciones realizadas durante el aprovisionamiento se registran en AWS CloudTrail.

Qué significa esto en la práctica

El trabajo de configuración manual que antes se realizaba en varias consolas ahora se lleva a cabo en una sola sesión de forma nativa desde el espacio de trabajo de Databricks. El aprovisionamiento automatizado elimina los fallos más comunes, como políticas de confianza incorrectas, falta de permisos en los buckets o ARNs mal configurados, al tiempo que garantiza que cada rol de IAM creado siga los principios de mínimo privilegio alineados con los estándares de seguridad empresarial.

A medida que más personas adoptan la arquitectura LTAP, una conectividad de S3 más sencilla elimina una barrera de infraestructura clave al proporcionar un destino de almacenamiento en la nube gobernado donde los motores analíticos pueden consultar instantáneamente los datos operativos sin necesidad de pipelines independientes.

Más información

En tu espacio de trabajo, navega a Catalog Explorer → External Locations → Create (/explore/locations/create) para conectar automáticamente tu bucket de S3 con la configuración automática.

Para obtener más información:

(Esta entrada del blog ha sido traducida utilizando herramientas basadas en inteligencia artificial) Publicación original

Recibe las últimas publicaciones en tu bandeja de entrada

Suscríbete a nuestro blog y recibe las últimas publicaciones directamente en tu bandeja de entrada.