Connectez votre éditeur local ou votre CLI au calcul Databricks, à l'espace de travail et à Unity Catalog pour un développement fluide en ingénierie des données et en ML.
par Tanishq Maheshwari et Matt Jones
L'espace de travail Databricks est conçu spécifiquement pour l'analyse et l'ingénierie des données. Cependant, vous préférerez peut-être utiliser des IDE locaux et l'interface CLI pour tirer parti de vos propres outils et agents de codage comme Cursor, Copilot et Claude Code. C'est particulièrement vrai lors du développement de pipelines complexes à grande échelle ou de modèles de machine learning.
Jus'qu'à présent, l'extension Databricks pour Visual Studio et Cursor et Databricks Connect permettaient le développement Spark local à l'aide du calcul Databricks. Mais l'exécution à distance de workloads non-Spark et la synchronisation des dépendances avec Databricks Runtime restaient des points de friction courants.
Nous comblons désormais ces lacunes. Grâce à nos dernières mises à jour de l'expérience IDE, vous pouvez désormais connecter VS Code, Cursor ou votre terminal directement au calcul Databricks. Exécutez, déboguez et mettez à l'échelle des workloads Python et SQL sur une infrastructure de cluster réelle tout en conservant toute l'ergonomie de votre IDE.
Grâce à notre nouveau tunnel SSH (voir la documentation), vous pouvez connecter votre éditeur local ou votre CLI à Serverless, AI Runtime et à des clusters dédiés :
Exécutez et déboguez de manière interactive les fichiers et notebooks de l'espace de travail depuis VS Code, Cursor ou la CLI.
Utilisez le même environnement sur l'IDE et l'espace de travail, vos dépendances et vos fichiers sont toujours synchronisés avec Databricks Runtime et l'espace de travail.
Tirez parti des agents de codage dans le tunnel SSH afin qu'ils disposent de tout le contexte de l'espace de travail et collaborent plus efficacement avec Databricks. Cursor et Copilot fonctionnent immédiatement, tandis que d'autres agents comme Claude Code peuvent être installés lorsque le tunnel SSH est actif.
La prise en main est simple. Vous pouvez vous connecter au tunnel SSH avec une seule commande à l'aide de la Databricks CLI :
databricks ssh connect pour vous connecter à serverless.databricks ssh connect --accelerator <GPU_type> pour vous connecter à AI Runtime où le type de GPU peut être (GPU_1xA10 ou GPU_8xH100).databricks ssh connect --cluster <cluster_id> pour vous connecter à un cluster dédié.Vous pouvez également démarrer le tunnel SSH dans un IDE en incluant --ide vscode ou --ide cursor comme flag supplémentaire.
Sinon, vous pouvez démarrer le tunnel SSH directement depuis la version la plus récente de l'extension IDE.

Nous avons également inclus d'autres fonctionnalités qui facilitent l'utilisation de la CLI et de l'IDE comme espace de travail principal :
--base-environment pour démarrer votre tunnel SSH avec les dépendances Python préinstallées. Voir--usage-policy-id pour suivre les coûts du tunnel SSH par utilisateur, équipe ou projet.
Pour plus de détails sur la connexion au tunnel SSH, consultez la documentation ici.
Grâce à ces fonctionnalités, vous pouvez développer depuis l'environnement de votre choix tout en opérant à la pointe de l'ingénierie des données et du ML. Dirigez votre IDE et vos agents vers Databricks, exécutez et déboguez sur du calcul réel, et maintenez une boucle de développement rapide.
Pour commencer à utiliser les outils de développement présentés dans ce blog, consultez la documentation suivante :
Pour comprendre quels outils répondent le mieux à vos besoins, consultez Se connecter depuis votre IDE.
(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original
Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.