Ir para o conteúdo principal
Produto

Conecte dados do Amazon S3 ao Databricks com permissões delegadas do IAM

Configure uma conexão segura do S3 com o Databricks em minutos com o novo fluxo de criação de local externo

por Gordon Wang

  • Por que uma conectividade S3 mais simples é importante
  • Como funciona a delegação temporária do AWS IAM para o S3
  • Como configurar um local externo com o novo fluxo

Importância de uma conectividade S3 mais simples

Conectar o Amazon S3 é uma das etapas de configuração mais importantes para extrair valor do Databricks. Os locais externos fornecem a conexão governada entre seu bucket do S3 e o Unity Catalog para que o Databricks possa ler e gravar dados com segurança. Essa configuração é fundamental para fluxos de trabalho comuns, desde ingestão e pipelines até análise e governança. Ela também é cada vez mais importante à medida que mais pessoas adotam o LTAP (Lake Transactional/Analytical Processing), uma nova arquitetura projetada para unificar dados transacionais e analíticos em uma única base governada, sem a sobrecarga tradicional de pipelines, réplicas e ETL.

Hoje, os clientes autorizam a conectividade do S3 criando um local externo, um objeto do Unity Catalog que combina um caminho de armazenamento com uma credencial de armazenamento para autorizar o acesso de leitura e gravação ao seu bucket do S3.

image1.png

Até agora, conectar-se ao S3 costumava ser uma das partes mais complicadas para começar a usar o Databricks. A configuração automática ajuda os clientes a gastar menos tempo gerenciando a infraestrutura de nuvem e mais tempo criando inteligência de dados com base em seus dados.

Como funciona a conectividade automatizada do S3

Conectar um bucket do Amazon S3 ao Databricks exige a criação de um local externo, uma conexão registrada no Unity Catalog que governa como o Databricks lê e grava seus dados. Anteriormente, isso significava criar políticas de confiança do IAM de 140 linhas, configurar permissões de bucket do S3, implantar templates do CloudFormation e alternar entre o console da AWS e o Databricks para registrar tudo corretamente.

Agora, tornamos isso possível com apenas alguns cliques simples:

image2.gif

O que acontece por trás dos panos?

Esse novo fluxo é baseado na delegação temporária do AWS IAM. Depois de especificar seu bucket do S3 e o nível de acesso, você será solicitado a fazer login na AWS para verificar suas permissões. Se tiver acesso suficiente, você poderá conceder ao Databricks uma autorização temporária e com limite de tempo para provisionar os recursos necessários em seu nome. Usuários que não possuem permissões suficientes da AWS podem solicitá-las diretamente ao administrador da AWS dentro do fluxo.

Com essa delegação configurada, o Databricks cuida automaticamente do resto:

  • Credencial de armazenamento: uma função do IAM com permissões de privilégio mínimo é criada e a política de confiança entre contas é configurada corretamente.
  • Local externo: um local externo totalmente configurado e registrado no Unity Catalog, mapeado para o bucket especificado. O Auto Loader e o File Events são ativados automaticamente.
    Assim que a configuração for concluída, a autorização expira automaticamente. O Databricks nunca mantém acesso permanente à sua conta da AWS, e todas as ações realizadas durante o provisionamento são registradas no AWS CloudTrail.

O que isso significa na prática

O trabalho de configuração manual que antes ocorria em vários consoles agora acontece em uma única sessão, de forma nativa no espaço de trabalho do Databricks. O provisionamento automatizado elimina os modos de falha mais comuns, como políticas de confiança incorretas, falta de permissões de bucket e ARNs configurados incorretamente, além de garantir que cada função do IAM criada siga os princípios de privilégio mínimo alinhados aos padrões de segurança corporativos.

À medida que mais pessoas adotam a arquitetura LTAP, a conectividade S3 mais simples remove uma barreira importante de infraestrutura, fornecendo um destino de armazenamento em nuvem governado onde os dados operacionais podem ser consultados instantaneamente por mecanismos analíticos sem a necessidade de pipelines separados.

Saiba mais

No seu espaço de trabalho, navegue até Catalog Explorer → External Locations → Create (/explore/locations/create) para conectar automaticamente seu bucket do S3 com a configuração automática.

Para mais informações:

(Esta publicação no blog foi traduzida utilizando ferramentas baseadas em inteligência artificial) Publicação original

Receba os posts mais recentes na sua caixa de entrada

Assine nosso blog e receba os posts mais recentes diretamente na sua caixa de entrada.