주요 컨텐츠로 이동
플랫폼

로컬 IDE에서 Databricks 워크로드 실행, 디버깅 및 확장

원활한 데이터 엔지니어링 및 ML 개발을 위해 로컬 에디터 또는 CLI를 Databricks 컴퓨팅, 작업 공간 및 Unity Catalog에 연결하세요.

작성자: Tanishq Maheshwari , Matt Jones

  • IDE에서 대화형으로 Databricks 워크로드 실행 및 디버깅: Serverless, AI Runtime 및 전용 클러스터에 연결합니다.
  • 작업 공간으로의 전환 최소화: IDE에서 직접 Unity Catalog를 탐색하고 작업 공간 파일을 편집합니다.
  • IDE와 작업 공간 간의 단일 환경 관리: 파일과 프로젝트 종속성이 항상 동기화됩니다.

Databricks 작업 공간은 데이터 분석 및 데이터 엔지니어링을 위해 특별히 구축되었습니다. 하지만 자신만의 도구와 Cursor, Copilot, Claude Code와 같은 코딩 에이전트를 활용하기 위해 로컬 IDE 및 CLI를 사용하는 것을 더 선호할 수도 있습니다. 복잡하고 대규모인 파이프라인이나 머신러닝 모델을 개발할 때 특히 그렇습니다.

지금까지는 Visual Studio 및 Cursor용 Databricks 확장 프로그램Databricks Connect를 통해 Databricks 컴퓨팅을 사용한 로컬 Spark 개발이 가능했습니다. 하지만 Spark가 아닌 워크로드를 원격으로 실행하고 종속성을 Databricks Runtime과 동기화 상태로 유지하는 것은 여전히 흔한 문제점이었습니다.

이제 이러한 격차를 해소하고자 합니다. IDE 환경에 대한 최신 업데이트를 통해 이제 VS Code, Cursor 또는 터미널을 Databricks 컴퓨팅에 직접 연결할 수 있습니다. IDE의 모든 편의성을 유지하면서 실제 클러스터 인프라에서 Python 및 SQL 워크로드를 실행, 디버깅 및 확장해 보세요.

타협 없는 원격 실행

새로운 SSH 터널(문서 참조)을 사용하면 로컬 에디터 또는 CLI를 Serverless, AI Runtime 및 전용 클러스터에 연결할 수 있습니다.

  • VS Code, Cursor 또는 CLI에서 작업 공간 파일과 노트북을 대화형으로 실행하고 디버깅합니다.

     

  • IDE와 작업 공간 전체에서 동일한 환경을 사용하세요. 종속성과 파일이 항상 Databricks Runtime 및 작업 공간과 동기화됩니다.

     

  • SSH 터널에서 코딩 에이전트를 활용하여 전체 작업 공간 컨텍스트를 파악하고 Databricks와 더 효과적으로 연동할 수 있도록 하세요. Cursor 및 Copilot은 즉시 작동하며, Claude Code와 같은 다른 에이전트는 SSH 터널이 실행 중일 때 설치할 수 있습니다.

시작하는 방법은 간단합니다. Databricks CLI를 사용하여 단일 명령어로 SSH 터널에 연결할 수 있습니다.

  • databricks ssh connect를 사용하여 serverless에 연결합니다.
  • databricks ssh connect --accelerator <GPU_type>를 사용하여 AI Runtime에 연결합니다. 여기서 GPU 유형은 (GPU_1xA10 또는 GPU_8xH100)일 수 있습니다.
  • databricks ssh connect --cluster <cluster_id>를 사용하여 전용 클러스터에 연결합니다.

추가 플래그로 --ide vscode 또는 --ide cursor를 포함하여 IDE에서 SSH 터널을 시작할 수도 있습니다.

또는 최신 버전의 IDE 확장 프로그램에서 직접 SSH 터널을 시작할 수도 있습니다.

SSH 터널 시작

또한 CLI 및 IDE를 주요 작업 공간으로 더 쉽게 사용할 수 있도록 지원하는 다른 기능도 포함되어 있습니다.

  • 프로젝트 종속성 관리(문서): --base-environment 플래그를 사용하여 작업 공간 기본 환경을 지정하면 Python 종속성이 사전 설치된 상태로 SSH 터널을 시작할 수 있습니다.
  • 사용량 및 비용 모니터링(문서): --usage-policy-id 플래그를 사용하여 serverless 사용량 정책을 연결하면 사용자, 팀 또는 프로젝트별로 SSH 터널 비용을 추적할 수 있습니다.
  • IDE에서 Unity Catalog를 사용하여 데이터 자산 탐색(문서): 개발 흐름 중간에 작업 공간으로 전환할 필요 없이 카탈로그, 스키마 및 모든 데이터 자산을 탐색할 수 있습니다.

 

SSH 터널 연결에 대한 자세한 내용은 여기에서 문서를 확인하세요.

향후 계획

  • SSH 터널 사용자를 위해 Unity AI Gateway가 자동으로 구성되므로 모든 에이전트, 도구, 모델 및 MCP에 대한 액세스 및 지출을 제어할 수 있습니다.
  • 기존 IDE 확장 프로그램이 SSH 터널에 통합되어 IDE의 사용자 인터페이스에서 선언적 자동화 번들(Declarative Automation Bundles)을 배포하고 관리할 수 있습니다.
  • SSH 터널 시작 시 Python이 아닌 종속성 및 맞춤형 Docker 이미지를 구성할 수 있으므로 환경을 완전히 제어할 수 있습니다.

결론

이러한 기능을 사용하면 데이터 및 ML 엔지니어링의 최전선에서 작업하면서 선호하는 어떤 환경에서든 개발할 수 있습니다. IDE와 에이전트의 방향을 Databricks로 설정하고, 실제 컴퓨팅을 대상으로 실행 및 디버깅하며, 빠른 개발 루프를 유지해 보세요.

자세히 알아보기 + 다음 단계

블로그에 소개된 개발 도구를 시작하려면 다음 문서를 확인하세요.

  • 'SSH 터널' (AWS | Azure | GCP)
    Databricks 작업 공간 내에서 모든 코드와 데이터를 안전하게 유지하면서, IDE 또는 CLI에서 Python 및 SQL 워크로드를 대화형으로 실행하기 위해 Databricks 컴퓨팅에 연결합니다.
  • 'IDE 확장 프로그램' (AWS | Azure | GCP)
    로컬 파일로 작업하고 IDE의 사용자 인터페이스를 사용하여 선언적 자동화 번들(Declarative Automation Bundles)을 정의, 배포 및 실행합니다.
  • 'Databricks Connect' (AWS | Azure | GCP)
    로컬 개발 환경을 Databricks 컴퓨팅에 연결하여 원격으로 Spark 워크로드를 실행합니다.
  • 'Unity AI Gateway' (AWS | Azure | GCP)
    팀이 사용할 수 있는 AI 서비스를 제어하고, AI 트래픽을 라우팅 및 관리하며, 가드레일을 설정하고, 단일 제어 평면에서 사용량을 모니터링합니다.

귀하의 요구 사항에 가장 잘 맞는 도구를 이해하려면 IDE에서 연결을 참조하세요.

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.