Le convertisseur agentique, désormais en version bêta, utilise Genie Code pour convertir T-SQL, Snowflake, Redshift, Oracle, BigQuery et Teradata en ANSI SQL ouvert
par Jonathan Brito
Migrer depuis un entrepôt de données hérité est une entreprise complexe, qui oblige les équipes à analyser du code vieux de plusieurs décennies, à traduire des dialectes propriétaires, à migrer des ensembles de données massifs et à concilier les différences entre les systèmes. Databricks facilite considérablement la migration des charges de travail depuis les entrepôts de données hérités vers le Lakehouse avec Genie Code, l'agent de codage AI de Databricks.
Nous sommes ravis d'annoncer le nouveau convertisseur agentique dans Genie Code. Le convertisseur de code agentique traduit les dialectes propriétaires en ANSI SQL ouvert, à commencer par T-SQL, Snowflake, Redshift, Oracle, BigQuery et Teradata. Il transforme la migration d'un entrepôt de données d'un projet que votre équipe doit doter en personnel et gérer en un projet que vous configurez, lancez et surveillez.
Pour voir comment le convertisseur agentique fonctionne en pratique, nous allons détailler une preuve de concept convertissant un ensemble de procédures stockées T-SQL en ANSI SQL.
Pour démarrer la migration, nous créons un projet de migration, une nouvelle fonctionnalité dans un espace de travail Databricks. Les projets de migration offrent aux équipes un hub central pour gérer les fichiers sources, suivre la progression de la conversion et collaborer tout au long de la migration. Nous nommons notre projet Migration Project - POC, définissons le dialecte source sur T-SQL, la cible sur ANSI SQL, et choisissons un dossier de destination pour les fichiers convertis. Une fois créé, nous pouvons remplir le projet avec des fichiers SQL sources, préalablement téléchargés dans l'espace de travail. Chaque fichier apparaît dans le projet avec son type de fichier, ses lignes de code et son statut de migration :

Genie Code analyse et évalue la complexité de chaque fichier, affichant une évaluation dans le panneau de droite. Dans notre exemple, mixed_5cats_sp_string_agg.sql obtient un score de faible complexité car il ne contient que des fonctionnalités SQL qui s'associent parfaitement à ANSI SQL. Pour une migration à grande échelle, les équipes peuvent utiliser le score de complexité pour hiérarchiser et traiter d'abord les fichiers les plus simples.

Genie Code génère également le lignage, cartographiant chaque relation entre les objets de l'environnement hérité — tables, vues et procédures stockées. Le graphique de lignage montre que sps_sp_update_from.sql et sps_sp_pivot.sql n'ont pas de dépendances partagées, ce qui signifie qu'ils peuvent être migrés indépendamment en toute sécurité.

Dans une migration à grande échelle, la complexité et le lignage donnent aux équipes une image claire de ce qu'il faut migrer, dans quel ordre, et de ce qui doit être déplacé ensemble.
Après avoir analysé le code source, nous pouvons commencer à convertir le code. Lorsque nous cliquons sur Run, Genie Code analyse le T-SQL de chaque script et lance des essaims de sous-agents pour convertir les fichiers en parallèle. Chaque sous-agent corrige les erreurs de manière itérative, validant à la fois la syntaxe et l'intention sémantique pour garantir que le code converti conserve la logique métier d'origine et s'analyse correctement.
Une fois l'opération terminée, les fichiers convertis sont écrits dans le dossier de destination et dotés d'un code couleur selon leur statut. Dans notre preuve de concept, 6 fichiers sur 8 ont été convertis avec succès. Cependant, mixed_5cats_sp_string_agg.sql et mixed_6cats_sp_string_agg.sql nécessitent un examen plus approfondi. En consultant le panneau de droite, nous pouvons voir la liste des tâches requises pour corriger le script. Genie Code explique que les procédures stockées signalées doivent être qualifiées par un nom en trois parties dans Unity Catalog (catalog.schema.sp_string_agg).

En cliquant sur le fichier, nous pouvons ouvrir l'éditeur SQL natif pour explorer les différences côte à côte. Nous pouvons effectuer la correction manuellement dans l'éditeur ou codifier une règle de conversion en créant une compétence personnalisée dans Genie Code. Lorsque nous serons prêts à lancer la migration complète, Genie Code appliquera la règle, dans ce cas en attribuant automatiquement un nom en trois parties aux procédures stockées dans Unity Catalog, sur l'ensemble de la base de code. Les compétences personnalisées sont également utiles pour une personnalisation plus large, comme la conformité à un modèle ETL approuvé ou le respect des conventions de nommage internes.
Pour les équipes qui cherchent à effectuer une migration de type « lift-and-shift », Databricks propose la suite complète de fonctionnalités SQL d'entreprise. Les transactions multi-instructions, les tables temporaires et les procédures stockées — des fonctionnalités couramment utilisées dans les entrepôts de données hérités – sont toutes disponibles dans Databricks, il n'est donc pas nécessaire de réorganiser votre logique pour l'adapter à une nouvelle plateforme.
Le convertisseur de code agentique représente la nouvelle génération d'outils de migration d'entrepôts de données, s'appuyant sur le succès à grande échelle de Lakebridge. Depuis son lancement au Data and AI Summit 2025, l'outil de conversion de Lakebridge a aidé plus d'un millier de clients à adopter le lakehouse de Databricks :
« Lakebridge a rendu notre migration vers Databricks plus prévisible et plus efficace. Il a géré la conversion de nos procédures stockées héritées en Spark Declarative Pipelines, ce qui a réduit considérablement le travail manuel et nous a permis de progresser plus rapidement vers un Lakehouse ouvert et consolidé. »—Shane Irons, Directeur principal de la gestion de l'information
Dans un second temps, nous élargissons le convertisseur agentique pour prendre en charge les sources ETL héritées courantes et de nouveaux dialectes cibles. Nous prévoyons également d'intégrer la migration et la réconciliation des données dans l'expérience du projet de migration, avec une intégration native de Lakeflow Connect pour migrer les données et des outils automatisés pour valider que les données migrées correspondent à la source avant la bascule.
Prêt à migrer ? Contactez votre équipe de compte Databricks pour évaluer votre environnement hérité et essayer le convertisseur de code agentique ici.
(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original
Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.