Direkt zum Hauptinhalt
Plattform

Databricks-Workloads über Ihre lokale IDE ausführen, debuggen und skalieren

Verbinden Sie Ihren lokalen Editor oder Ihre CLI mit Databricks-Compute, dem Arbeitsbereich und Unity Catalog für ein nahtloses Data Engineering und eine reibungslose ML-Entwicklung.

von Tanishq Maheshwari und Matt Jones

  • Databricks-Workloads interaktiv über Ihre IDE ausführen und debuggen: Stellen Sie eine Verbindung zu Serverless, AI Runtime und dedizierten Clustern her.
  • Weniger Wechsel zum Arbeitsbereich: Durchsuchen Sie Unity Catalog und bearbeiten Sie Ihre Arbeitsbereichsdateien direkt in der IDE.
  • Eine einzige Umgebung für IDE und Arbeitsbereich verwalten: Ihre Dateien und Projekt-Abhängigkeiten sind immer synchronisiert.

Der Databricks-Arbeitsbereich wurde speziell für die Datenanalyse und das Data Engineering entwickelt. Möglicherweise bevorzugen Sie jedoch die Verwendung lokaler IDEs und der CLI, um Ihre eigenen Tools und Coding-Assistenten wie Cursor, Copilot und Claude Code zu nutzen. Dies gilt insbesondere für die Entwicklung komplexer, umfangreicher Pipelines oder Machine-Learning-Modelle.

Bisher ermöglichten die Databricks-Erweiterung für Visual Studio und Cursor und Databricks Connect die lokale Spark-Entwicklung mithilfe von Databricks-Compute. Die Remote-Ausführung von Nicht-Spark-Workloads und die Synchronisierung von Abhängigkeiten mit der Databricks Runtime blieben jedoch häufige Schwachstellen.

Diese Lücken schließen wir nun. Mit unseren neuesten Updates für die IDE-Erfahrung können Sie VS Code, Cursor oder Ihr Terminal jetzt direkt mit Databricks-Compute verbinden. Führen Sie Python- und SQL-Workloads auf einer echten Cluster-Infrastruktur aus, debuggen und skalieren Sie sie, während Sie gleichzeitig die gewohnte Ergonomie Ihrer IDE beibehalten.

Remote-Ausführung ohne Kompromisse

Über unseren neuen SSH-Tunnel (siehe Dokumentation) können Sie Ihren lokalen Editor oder Ihre CLI mit Serverless, AI Runtime und dedizierten Clustern verbinden:

  • Interaktives Ausführen und Debuggen von Arbeitsbereichsdateien und Notebooks über VS Code, Cursor oder die CLI.

     

  • Nutzen Sie dieselbe Umgebung in der IDE und im Arbeitsbereich – Ihre Abhängigkeiten und Dateien sind immer mit der Databricks Runtime und dem Arbeitsbereich synchronisiert.

     

  • Nutzen Sie Coding-Assistenten im SSH-Tunnel, damit diese den vollen Kontext des Arbeitsbereichs haben und effektiver mit Databricks arbeiten können. Cursor und Copilot funktionieren direkt, während andere Assistenten wie Claude Code installiert werden können, wenn der SSH-Tunnel aktiv ist.

Der Einstieg ist ganz einfach. Sie können die Verbindung zum SSH-Tunnel mit einem einzigen Befehl über die Databricks CLI herstellen:

  • databricks ssh connect, um eine Verbindung zu Serverless herzustellen.
  • databricks ssh connect --accelerator <GPU_type>, um eine Verbindung zur AI Runtime herzustellen, wobei der GPU-Typ (GPU_1xA10 oder GPU_8xH100) sein kann.
  • databricks ssh connect --cluster <cluster_id>, um eine Verbindung zu einem dedizierten Cluster herzustellen.

Sie können den SSH-Tunnel auch in einer IDE starten, indem Sie --ide vscode oder --ide cursor als zusätzliches Flag angeben.

Alternativ können Sie den SSH-Tunnel direkt aus der neuesten Version der IDE-Erweiterung starten.

SSH-Tunnel starten

Wir haben außerdem weitere Funktionen hinzugefügt, die die Nutzung von CLI und IDE als Hauptarbeitsplatz erleichtern:

  • Projekt-Abhängigkeiten verwalten (Dokumentation): Geben Sie eine Arbeitsbereich-Basisumgebung mit dem Flag --base-environment an, um Ihren SSH-Tunnel mit vorinstallierten Python-Abhängigkeiten zu starten. Siehe
  • Nutzung und Kosten überwachen (Dokumentation): Fügen Sie eine Serverless-Nutzungsrichtlinie mit dem Flag --usage-policy-id hinzu, um die Kosten für den SSH-Tunnel nach Benutzer, Team oder Projekt zu verfolgen.
  • Daten-Assets über Unity Catalog aus der IDE heraus erkunden (Dokumentation): Durchsuchen Sie Kataloge, Schemata und alle Ihre Daten-Assets, ohne mitten im Entwicklungsfluss zum Arbeitsbereich wechseln zu müssen.

 

Ausführliche Informationen zum Herstellen einer Verbindung mit dem SSH-Tunnel finden Sie in der Dokumentation hier.

Was als Nächstes kommt

  • Unity AI Gateway wird für SSH-Tunnel-Benutzer automatisch konfiguriert, sodass Sie den Zugriff und die Ausgaben für jeden Assistenten, jedes Tool, jedes Modell und jedes MCP steuern können.
  • Die bestehende IDE-Erweiterung wird in den SSH-Tunnel integriert, sodass Sie Declarative Automation Bundles direkt über eine Benutzeroberfläche in der IDE bereitstellen und verwalten können.
  • Nicht-Python-Abhängigkeiten und benutzerdefinierte Docker-Images können beim Start des SSH-Tunnels konfiguriert werden, sodass Sie die volle Kontrolle über Ihre Umgebung haben.

Fazit

Mit diesen Funktionen können Sie in Ihrer bevorzugten Umgebung entwickeln und gleichzeitig an der Spitze des Daten- und ML-Engineerings arbeiten. Richten Sie Ihre IDE und Ihre Assistenten auf Databricks aus, führen Sie Code auf echten Compute-Ressourcen aus, debuggen Sie ihn und profitieren Sie von einem schnellen Entwicklungszyklus.

Mehr erfahren + Nächste Schritte

Um mit den in diesem Blog vorgestellten Entwicklungstools loszulegen, lesen Sie bitte die folgende Dokumentation:

  • „SSH-Tunnel“ (AWS | Azure | GCP)
    Stellen Sie eine Verbindung zu Databricks-Compute her, um Python- und SQL-Workloads interaktiv über die IDE oder CLI auszuführen, während der gesamte Code und alle Daten in Ihrem Databricks-Arbeitsbereich sicher bleiben.
  • „IDE-Erweiterung“ (AWS | Azure | GCP)
    Arbeiten Sie mit lokalen Dateien und definieren, implementieren und führen Sie Declarative Automation Bundles über eine Benutzeroberfläche in der IDE aus.
  • „Databricks Connect“ (AWS | Azure | GCP)
    Verbinden Sie Ihre lokale Entwicklungsumgebung mit Databricks-Compute, um Spark-Workloads remote auszuführen.
  • „Unity AI Gateway“ (AWS | Azure | GCP)
    Steuern Sie, welche KI-Dienste Teams nutzen können, leiten und verwalten Sie den KI-Datenverkehr, legen Sie Leitplanken fest und überwachen Sie die Nutzung über eine einzige Steuerungsebene.

Um herauszufinden, welche Tools am besten zu Ihren Anforderungen passen, siehe Verbindung über Ihre IDE herstellen.

(Dieser Blogbeitrag wurde mit KI-gestützten Tools übersetzt.) Originalbeitrag

Erhalten Sie die neuesten Beiträge in Ihrem Posteingang

Abonnieren Sie unseren Blog und erhalten Sie die neuesten Beiträge direkt in Ihren Posteingang.