Revenir au contenu principal
Annonces

Adaptive Instructed-Retriever : recherche de pointe avec une latence 2x plus faible

par Cindy Wang, Cheng Li, Jialu Liu, Sean Kulinski, Arnav Singhvi, Wen Sun et Michael Bendersky

Les agents de données d'entreprise efficaces nécessitent une recherche à la fois précise et rapide. Plus tôt cette année, nous avons lancé Instructed-Retriever-1, un modèle de recherche capable d'intégrer des schémas de données d'entreprise et des instructions personnalisées tout en utilisant une mise à l'échelle parallèle au moment du test (test-time scaling) pour améliorer la précision de la recherche avec une faible latence. Cette approche de recherche en une seule étape fonctionne bien pour une grande partie des requêtes des utilisateurs. Cependant, les questions plus complexes à sauts multiples (multi-hop) peuvent encore bénéficier d'une recherche séquentielle, où le modèle rassemble des preuves de manière itérative et affine ses requêtes sur plusieurs étapes – au détriment d'une latence supplémentaire.

C'est pourquoi nous présentons aujourd'hui Adaptive Instructed-Retriever, qui combine la rapidité de la recherche parallèle avec les performances de la recherche séquentielle, tout en maintenant des garanties strictes en matière de coût et de latence. L'objectif est simple : ne consacrer des étapes de recherche supplémentaires que lorsqu'elles sont utiles. C'est le même problème d'efficacité de recherche auquel est confronté Genie Code, l'agent de données de Databricks : il doit trouver les bons tableaux, notebooks, tableaux de bord et documents dans un espace de travail vaste et évolutif, sans perdre de temps en explorations par force brute. Adaptive Instructed-Retriever est conçu pour cette couche de recherche, fournissant des résultats rapidement lorsque les preuves sont claires et n'utilisant la recherche séquentielle que lorsqu'une requête plus difficile l'exige. Comme nous le montrons dans cet article, le modèle entraîné égale la qualité des principaux modèles tiers avec une latence deux fois plus faible, et s'améliore considérablement par rapport à la recherche en une seule étape sur nos benchmarks de recherche.

score et latence de bout en bout mesurés sur la suite de benchmarks de recherche

Pour concevoir Adaptive Instructed-Retriever, nous imposons une limite supérieure fixe au nombre d'étapes séquentielles et entraînons l'agent à décider de manière adaptative de la quantité de calcul requise par chaque requête utilisateur. Lorsque des preuves suffisantes ont déjà été trouvées, l'agent s'arrête prématurément et renvoie les preuves pertinentes ; lorsqu'une recherche supplémentaire est susceptible d'améliorer la qualité de la recherche, il peut continuer à chercher jusqu'à la limite d'étapes.

Figure 1. Architecture d'Adaptive Instructed-Retriever qui permet une recherche agentique multi-étapes avec une latence limitée.
Figure 1. Architecture d'Adaptive Instructed-Retriever qui permet une recherche agentique multi-étapes avec une latence limitée.

Entraînement d'Adaptive Instructed-Retriever

Pour obtenir un meilleur équilibre entre la qualité de la recherche et le coût en latence de la mise à l'échelle séquentielle, nous avons entraîné Adaptive Instructed-Retriever – un petit modèle personnalisé qui prend en charge à la fois la recherche parallèle en une seule étape et la recherche séquentielle, tout en fonctionnant à une latence nettement inférieure à celle des principaux modèles tiers. Nous évaluons le modèle sur un mélange de benchmarks de recherche publics et propriétaires d'entreprises, y compris des tâches qui bénéficient d'un raisonnement à sauts multiples (multi-hop). Sur l'ensemble de ces benchmarks, Adaptive Instructed-Retriever atteint des performances comparables à celles des principaux modèles tiers et open source, tout en offrant une latence deux fois plus faible.

Pour préparer les données d'entraînement, nous nous appuyons sur des environnements de recherche d'entreprise synthétiques et sur un processus de synthèse de données agentique similaire à celui d'Instructed-Retriever-1 et publié dans le rapport KARL . Nous réutilisons les données d'entraînement existantes d'Instructed-Retriever-1 pour préserver la capacité du modèle à effectuer une recherche parallèle rapide en une seule étape, et nous introduisons également des questions synthétiques à sauts multiples qui bénéficient davantage de plusieurs étapes de recherche agentique.

À partir du modèle de base, nous utilisons l'apprentissage par renforcement en ligne (ORL) pour apprendre au modèle à n'effectuer des étapes de recherche supplémentaires que lorsqu'elles sont susceptibles d'améliorer les performances finales. Plus précisément, nous optimisons le modèle de bout en bout à l'aide de CISPO (Clipped Importance Sampling Policy Optimization), avec une conception de récompense qui équilibre la qualité de la trajectoire et le coût de la recherche : le modèle est récompensé pour les trajectoires performantes tout en étant pénalisé pour les étapes de recherche supplémentaires qui n'apportent pas de gains de performance correspondants.

Nous entraînons le modèle à l'aide d'AI Runtime (AIR). AIR est également disponible pour les clients de Databricks, ce qui rend cette approche pratique pour développer des modèles spécialisés pour leurs propres domaines et charges de travail. La recette d'entraînement est volontairement légère : nous partons d'un modèle de base pré-entraîné et utilisons une quantité modeste de données synthétiques pour spécialiser son comportement de recherche. Comme le montre la figure 2, notre approche légère se généralise bien à de nouvelles tâches et de nouveaux domaines de recherche.

Figure 2. Adaptive Instructed-Retriever atteint des performances comparables à Claude Sonnet 5 et GPT-5.6 Luna avec une latence nettement inférieure. Les résultats sont présentés sur un mélange de sept benchmarks internes et externes exclus couvrant plusieurs niveaux de difficulté de recherche et plusieurs domaines.
Figure 2. Adaptive Instructed-Retriever atteint des performances comparables à Claude Sonnet 5 et GPT-5.6 Luna avec une latence nettement inférieure. Les résultats sont présentés sur un mélange de sept benchmarks internes et externes exclus couvrant plusieurs niveaux de difficulté de recherche et plusieurs domaines.

La figure 2 compare l'Adaptive Instructed-Retriever à deux modèles tiers de premier plan (Claude Sonnet 5 et GPT-5.6 Luna) et à un modèle open source (DeepSeek-V4-Flash). Nous traçons la qualité de la recherche en fonction de la latence moyenne de bout en bout pour chaque modèle. La barre de couleur claire montre le score de recherche d'une seule étape de recherche tandis que la barre de couleur sombre montre le résultat de la recherche multi-étapes, mesuré par rapport à l'axe de gauche (plus le score est élevé, mieux c'est) ; la barre hachurée montre la latence de bout en bout par rapport à l'axe de droite (plus elle est faible, mieux c'est). Adaptive Instructed-Retriever égale les performances des principaux modèles tiers et open source tout en répondant en seulement 5,8 secondes, soit plus de 2 fois plus vite que Claude Sonnet 5, DeepSeek-V4-Flash ou GPT-5.6 Luna.

Apprentissage par renforcement en ligne pour des compromis qualité-latence personnalisés

L'entraînement d'Adaptive Instructed-Retriever nous permet de choisir le compromis qualité-latence en ajustant l'importance de la pénalité d'étape utilisée pendant l'ORL. Par conséquent, nous pouvons entraîner une famille de points de contrôle (checkpoints) qui alimente Adaptive Instructed-Retriever, et choisir celui qui convient le mieux à la charge de travail en production.

Figure 3. En ajustant le poids de la pénalité d'étape pendant l'entraînement ORL, nous pouvons choisir n'importe quel point de fonctionnement le long d'une frontière de Pareto qui domine DeepSeek-V4-Flash, Claude Sonnet 5 et GPT-5.6 Luna sur l'ensemble de la plage de budgets de recherche.
Figure 3. En ajustant le poids de la pénalité d'étape pendant l'entraînement ORL, nous pouvons choisir n'importe quel point de fonctionnement le long d'une frontière de Pareto qui domine DeepSeek-V4-Flash, Claude Sonnet 5 et GPT-5.6 Luna sur l'ensemble de la plage de budgets de recherche.

La figure 3 montre comment, en faisant varier l'importance de la pénalité pendant l'entraînement ORL, nous obtenons une famille de points de contrôle (checkpoints), chacun se situant à un point différent sur le plan qualité-latence — le score sur l'axe des ordonnées (plus il est élevé, mieux c'est) par rapport à la latence de bout en bout sur l'axe des abscisses (tracée de manière à ce que le plus rapide soit vers la droite). La courbe rouge relie ces points de fonctionnement pour former une frontière : une pénalité d'étape plus légère permet au modèle de franchir plus d'étapes et d'atteindre des scores plus élevés, tandis qu'une pénalité plus lourde réduit sa latence.

La frontière complète des modèles Adaptive Instructed-Retriever entraînés surpasse les alternatives. Par rapport au modèle de base Instructed-Retriever non entraîné, chaque point de contrôle offre une meilleure qualité à une latence similaire ou inférieure, ce qui suggère que les gains proviennent de l'apprentissage du moment où il faut chercher — et de celui où il ne faut pas le faire. Au sommet de la frontière, notre modèle atteint des scores comparables à ceux d'autres modèles de premier plan tout en étant plus de 2 fois plus rapide. Étant donné que la frontière entraînée comprend des points de contrôle avec différents compromis, nous pouvons choisir celui qui correspond le mieux à chaque charge de travail et à chaque budget – en privilégiant la vitesse pour une utilisation interactive ou la qualité pour une recherche hors ligne plus difficile.

Adaptive Instructed-Retriever formule une recherche plus efficace et ciblée

Nous présentons quelques exemples comparant les politiques de recherche des alternatives à celles de notre modèle Adaptive Instructed-Retriever entraîné. Ces exemples illustrent comment Adaptive Instructed-Retriever effectue des recherches efficaces sur des questions simples et, sur des questions plus difficiles, comment il peut utiliser plus efficacement son budget de recherche restant.

Vérifier une réponse négative sans recherche exhaustive

Adaptive Instructed-Retriever atteint la même récompense une étape plus tôt que Sonnet et deux étapes plus tôt que Luna.

Question : L'entreprise X indique-t-elle explicitement les coûts de restructuration en tant que poste du compte de résultat pour l'exercice 2022 (FY2022) ?

ModèleRecall@10Effort de rechercheComportement
GPT-5.6 Luna1.004 étapesRecherche des expressions spéculatives telles que « Il n'y avait pas de tels coûts » et « 0 million ».
Claude Sonnet 51.003 étapesVérifie l'état des résultats, la note de restructuration et les rapprochements connexes.
Adaptive Instructed-Retriever1.002 étapesVérifie le poste direct et les catégories de dépenses connexes, puis s'arrête une fois l'absence établie.

Utiliser le tour suivant pour changer de stratégie

Adaptive Instructed-Retriever apprend à ajuster sa stratégie de recherche pour améliorer le rappel : il passe d'une découverte large à des recherches de comptes ciblées. Il obtient la récompense la plus élevée tout en étant à égalité avec Sonnet pour le plus petit nombre d'étapes.

Question : Quels clients utilisent ou ont envisagé d'utiliser LiteLLM Proxy ?

ModèleRappel@10Effort de rechercheComportement
GPT-5.6 Luna0.624 étapesLes tours suivants répètent des combinaisons entre guillemets de « LiteLLM », « Proxy » et « client ».
Claude Sonnet 50.502 étapesS'arrête efficacement, mais son suivi générique manque des clients pertinents.
Adaptive Instructed-Retriever0.752 étapesUtilise le deuxième tour pour des hypothèses de comptes concrètes, y compris deux clients pertinents.

Conclusion

Adaptive Instructed-Retriever étend le modèle Instructed-Retriever-1 précédemment publié, passant d'une recherche parallèle en une seule étape à une recherche adaptative en plusieurs étapes. Cela permet au modèle de consacrer des étapes de recherche supplémentaires aux requêtes complexes où le raisonnement itératif et la collecte de preuves peuvent améliorer considérablement la qualité de la recherche, tout en s'arrêtant plus tôt sur les requêtes plus simples afin de minimiser la latence. Cette approche adaptative offre des performances de recherche nettement supérieures à celles de la recherche en une seule étape, tout en atteignant des performances comparables à celles des principaux modèles tiers avec une latence deux fois plus faible. En faisant varier la pénalité d'étape pendant l'apprentissage par renforcement en ligne, nous pouvons optimiser explicitement le compromis entre la qualité de la recherche et le coût d'inférence, en produisant des points de contrôle à différents niveaux de la frontière qualité-latence et en sélectionnant le point de fonctionnement qui correspond le mieux à une charge de travail en production.

Notre contribution fournit une brique de recherche pratique pour les agents de données chez Databricks opérant sur des espaces de travail volumineux et en constante évolution. Des expériences telles que Genie Code, Genie One et Genie Agents doivent trouver les bons tableaux, notebooks, tableaux de bord et documents sans consacrer trop de temps et d'efforts à une exploration approfondie. Adaptive Instructed-Retriever propose une politique bornée pour cette configuration : il est rapide pour les recherches courantes, tout en étant approfondi pour les tâches de découverte difficiles, et contrôlable dans la limite d'un budget de latence produit. Plus largement, ces résultats illustrent la compétitivité des petits modèles spécialisés\ même pour des tâches qui nécessitent un raisonnement en plusieurs étapes. Databricks AIR permet à nos clients d'adapter des modèles spécialisés à leurs propres domaines et exigences de performance.

(Cet article de blog a été traduit à l'aide d'outils basés sur l'intelligence artificielle) Article original

Recevez les derniers articles dans votre boîte mail

Abonnez-vous à notre blog et recevez les derniers articles directement dans votre boîte mail.