주요 컨텐츠로 이동
공지사항

Adaptive Instructed-Retriever: 2배 낮은 지연 시간으로 구현하는 최첨단 품질의 검색

작성자: Cindy Wang, Cheng Li, Jialu Liu, 션 쿨린스키, Arnav Singhvi, Wen Sun , Michael Bendersky

효과적인 엔터프라이즈 데이터 에이전트에는 정확하면서도 빠른 검색이 필요합니다. 올해 초 저희는 병렬 테스트 시간 스케일링(parallel test-time scaling)을 사용하여 낮은 지연 시간으로 검색 정확도를 향상시키는 동시에 엔터프라이즈 데이터 스키마와 사용자 지정 지침을 통합할 수 있는 검색 모델인 Instructed-Retriever-1을 출시했습니다. 이 단일 단계 검색 방식은 대부분의 사용자 요청에 잘 작동합니다. 하지만 더 복잡한 멀티홉(multi-hop) 질문은 모델이 여러 단계에 걸쳐 반복적으로 근거를 수집하고 쿼리를 세분화하는 순차 검색을 통해 여전히 이점을 얻을 수 있지만, 추가적인 지연 시간이 발생합니다.

이것이 바로 저희가 엄격한 비용 및 지연 시간 보장을 유지하면서 병렬 검색의 속도와 순차 검색의 성능을 결합한 Adaptive Instructed-Retriever를 선보이는 이유입니다. 목표는 간단합니다. 추가 검색 단계는 유용할 때만 사용하는 것입니다. 이는 Databricks의 데이터 에이전트인 Genie Code가 직면한 것과 동일한 검색 효율성 문제입니다. 즉, 무차별 대입 탐색에 차례를 낭비하지 않고 크고 변화하는 작업 공간에서 올바른 테이블, 노트북, 대시보드 및 문서를 찾아야 합니다. Adaptive Instructed-Retriever는 이 검색 레이어를 위해 설계되어, 근거가 명확할 때는 신속하게 결과를 반환하고 더 어려운 요청에 필요할 때만 순차 검색을 사용합니다. 이 게시물에서 보여주듯이, 학습된 모델은 2배 더 낮은 지연 시간으로 주요 서드파티 모델의 품질과 일치하며, 자체 검색 벤치마크에서 단일 단계 검색보다 크게 향상된 성능을 보여줍니다.

검색 벤치마크 스위트에서 측정된 점수 및 엔드투엔드 지연 시간

Adaptive Instructed-Retriever를 구축하기 위해, 저희는 순차 단계 수에 고정된 상한선을 두고 에이전트가 각 사용자 요청에 필요한 계산량을 적응적으로 결정하도록 학습시킵니다. 이미 충분한 근거를 찾은 경우 에이전트는 조기에 중단하고 관련 근거를 반환하며, 추가 검색이 검색 품질을 향상시킬 가능성이 있는 경우 단계 제한까지 검색을 계속할 수 있습니다.

그림 1. 제한된 지연 시간으로 다단계 에이전트 검색을 가능하게 하는 Adaptive Instructed-Retriever의 아키텍처.
그림 1. 제한된 지연 시간으로 다단계 에이전트 검색을 가능하게 하는 Adaptive Instructed-Retriever의 아키텍처.

Adaptive Instructed-Retriever 학습시키기

검색 품질과 순차적 스케일링의 지연 시간 비용 간의 더 나은 균형을 달성하기 위해, 저희는 주요 서드파티 모델보다 훨씬 낮은 지연 시간으로 작동하면서 병렬 단일 단계 검색과 순차 검색을 모두 지원하는 소형 맞춤형 모델인 Adaptive Instructed-Retriever를 학습시켰습니다. 저희는 멀티홉 추론의 이점을 활용하는 작업을 포함하여 독점 엔터프라이즈 검색 및 공개 검색 벤치마크를 혼합하여 모델을 평가합니다. 이러한 벤치마크 전반에서 Adaptive Instructed-Retriever는 2배 더 낮은 지연 시간을 제공하면서 주요 서드파티 및 오픈소스 모델에 필적하는 성능을 달성합니다.

학습 데이터를 준비하기 위해, 저희는 합성 엔터프라이즈 검색 환경과 Instructed-Retriever-1과 유사하고 KARL 보고서에 발표된 에이전트 기반 데이터 합성 프로세스에 의존합니다. 저희는 빠른 병렬 단일 단계 검색을 수행하는 모델의 능력을 보존하기 위해 Instructed-Retriever-1의 기존 학습 데이터를 재사용하고, 여러 에이전트 검색 단계의 이점을 더 많이 얻을 수 있는 합성 멀티홉 질문을 추가로 도입합니다.

기본 모델에서 시작하여, 저희는 온라인 강화 학습(ORL)을 사용하여 최종 성능을 향상시킬 가능성이 있을 때만 추가 검색 단계를 수행하도록 모델을 가르칩니다. 구체적으로, 저희는 경로(trajectory) 품질과 검색 비용의 균형을 맞추는 보상 설계를 통해 CISPO (Clipped Importance Sampling Policy Optimization)를 사용하여 모델을 엔드투엔드로 최적화합니다. 즉, 모델은 성능이 우수한 경로에 대해 보상을 받는 동시에 그에 상응하는 성능 향상을 가져오지 않는 추가 검색 단계에 대해서는 페널티를 받습니다.

저희는 AI Runtime (AIR)을 사용하여 모델을 학습시킵니다. AIR은 Databricks 고객도 사용할 수 있으므로, 이 접근 방식은 자체 도메인 및 워크로드에 특화된 모델을 개발하는 데 실용적입니다. 학습 레시피는 의도적으로 가볍게 구성되었습니다. 사전 학습된 기본 모델에서 시작하여 적당한 양의 합성 데이터를 사용해 검색 동작을 특화합니다. 그림 2에서 볼 수 있듯이, 저희의 가벼운 접근 방식은 새로운 검색 작업 및 도메인에 잘 일반화됩니다.

그림 2. Adaptive Instructed-Retriever는 현저히 낮은 지연 시간으로 Claude Sonnet 5 및 GPT-5.6 Luna와 유사한 성능을 달성합니다. 결과는 여러 검색 난이도와 도메인을 포괄하는 7개의 보류된(held-out) 내부 및 외부 벤치마크의 혼합물에 대해 보고됩니다.
그림 2. Adaptive Instructed-Retriever는 현저히 낮은 지연 시간으로 Claude Sonnet 5 및 GPT-5.6 Luna와 유사한 성능을 달성합니다. 결과는 여러 검색 난이도와 도메인을 포괄하는 7개의 보류된(held-out) 내부 및 외부 벤치마크의 혼합물에 대해 보고됩니다.

그림 2는 Adaptive Instructed-Retriever를 두 개의 주요 서드파티 모델(Claude Sonnet 5 및 GPT-5.6 Luna) 및 하나의 오픈소스 모델(DeepSeek-V4-Flash)과 비교합니다. 모든 모델에 대해 평균 엔드투엔드 지연 시간 대비 검색 품질을 그래프로 나타냅니다. 밝은 색상의 막대는 단일 검색 단계의 검색 점수를 나타내고 어두운 색상의 막대는 다단계 검색의 결과를 나타내며 왼쪽 축을 기준으로 측정됩니다(높을수록 좋음). 빗금 친 막대는 오른쪽 축을 기준으로 한 엔드투엔드 지연 시간을 나타냅니다(낮을수록 좋음). Adaptive Instructed-Retriever는 단 5.8초 만에 답변을 제공하면서 주요 서드파티 및 오픈소스 모델의 성능과 일치하며, Claude Sonnet 5, DeepSeek-V4-Flash 또는 GPT-5.6 Luna보다 2배 이상 빠릅니다.

맞춤형 품질-지연 시간 트레이드오프를 위한 온라인 강화 학습

Adaptive Instructed-Retriever를 학습시키면 ORL 중에 사용되는 단계 페널티의 크기를 조정하여 품질-지연 시간 트레이드오프를 선택할 수 있습니다. 따라서 Adaptive Instructed-Retriever를 구동하는 체크포인트 제품군을 학습시키고 프로덕션 워크로드에 적합한 것을 선택할 수 있습니다.

그림 3. ORL 학습 중 단계 페널티 가중치를 조정함으로써, 전체 검색 예산 범위에서 DeepSeek-V4-Flash, Claude Sonnet 5 및 GPT-5.6 Luna를 압도하는 파레토 프런티어(Pareto frontier)를 따라 임의의 작동 지점을 선택할 수 있습니다.
그림 3. ORL 학습 중 단계 페널티 가중치를 조정함으로써, 전체 검색 예산 범위에서 DeepSeek-V4-Flash, Claude Sonnet 5 및 GPT-5.6 Luna를 압도하는 파레토 프런티어(Pareto frontier)를 따라 임의의 작동 지점을 선택할 수 있습니다.

그림 3은 ORL 학습 중에 페널티 크기를 스윕하여 품질-지연 시간 평면의 서로 다른 지점에 도달하는 체크포인트 제품군을 얻는 방법을 보여줍니다. y축은 점수(높을수록 좋음), x축은 엔드투엔드 지연 시간(오른쪽으로 갈수록 빠름)을 나타냅니다. 빨간색 곡선은 이러한 작동 지점들을 프런티어(frontier)로 연결합니다. 단계 페널티가 가벼울수록 모델이 더 많은 단계를 수행하고 더 높은 점수에 도달할 수 있으며, 페널티가 무거울수록 지연 시간이 줄어듭니다.

학습된 Adaptive Instructed-Retriever 모델의 전체 프런티어는 대안 모델들보다 뛰어난 성능을 보입니다. 학습되지 않은 Instructed-Retriever 기본 모델과 비교했을 때, 모든 체크포인트는 비슷하거나 더 낮은 지연 시간에서 더 높은 품질을 제공하며, 이는 이점이 검색할 때와 검색하지 않을 때를 학습하는 데서 온다는 것을 시사합니다. 프런티어의 상단에서 저희 모델은 다른 주요 모델에 필적하는 점수에 도달하는 동시에 2배 이상 빠릅니다. 학습된 프런티어에는 다양한 트레이드오프를 가진 체크포인트가 포함되어 있으므로, 대화형 사용을 위해 속도를 선호하거나 더 까다로운 오프라인 검색을 위해 품질을 선호하는 등 각 워크로드와 예산에 가장 잘 맞는 체크포인트를 선택할 수 있습니다.

Adaptive Instructed-Retriever, 더 효율적이고 표적화된 검색 수립

대안 모델들의 검색 정책을 학습된 Adaptive Instructed-Retriever 모델의 검색 정책과 비교하는 몇 가지 예를 보여줍니다. 이 예시들은 Adaptive Instructed-Retriever가 간단한 질문에 대해 어떻게 효율적으로 검색하고, 더 어려운 질문에 대해 남은 검색 예산을 어떻게 더 효과적으로 사용할 수 있는지 보여줍니다.

철저한 검색 없이 부정적인 답변 검증하기

Adaptive Instructed-Retriever는 Sonnet보다 한 단계 일찍, Luna보다 두 단계 일찍 동일한 보상에 도달합니다.

질문: X사는 2022 회계연도(FY2022) 손익계산서 항목으로 구조조정 비용을 명시적으로 보고합니까?

모델Recall@10검색 노력동작
GPT-5.6 Luna1.004단계“There were no such costs” 및 “0 million”과 같은 추측성 문구를 검색합니다.
Claude Sonnet 51.003단계운영 명세서, 구조조정 주석 및 관련 조정을 확인합니다.
Adaptive Instructed-Retriever1.002단계직접적인 라인 항목 및 관련 비용 범주를 확인한 다음, 해당 항목이 없는 것이 확실해지면 중단합니다.

다음 라운드에서 전략 변경하기

Adaptive Instructed-Retriever는 재현율(recall)을 개선하기 위해 검색 전략을 조정하는 방법을 학습합니다. 즉, 광범위한 탐색에서 표적화된 계정 검색으로 전환합니다. 가장 적은 단계 수로 Sonnet과 동률을 이루면서도 가장 높은 보상을 달성합니다.

질문: 어떤 고객이 LiteLLM Proxy를 사용 중이거나 사용을 고려했나요?

모델Recall@10검색 노력동작
GPT-5.6 Luna0.624단계이후 라운드에서 “LiteLLM”, “Proxy”, “customer”의 따옴표가 붙은 조합을 반복합니다.
Claude Sonnet 50.502단계효율적으로 중단되지만, 일반적인 후속 조치로 인해 관련 고객을 놓칩니다.
Adaptive Instructed-Retriever0.752단계두 명의 관련 고객을 포함하여 구체적인 계정 가설을 세우는 데 두 번째 라운드를 사용합니다.

결론

Adaptive Instructed-Retriever는 이전에 발표된 Instructed-Retriever-1을 병렬 단일 단계 검색에서 적응형 다단계 검색으로 확장하여, 반복적인 추론과 증거 수집을 통해 검색 품질을 크게 향상시킬 수 있는 복잡한 쿼리에 추가적인 검색 단계를 할애하는 동시에, 더 간단한 쿼리에서는 조기에 반환하여 대기 시간(latency)을 최소화할 수 있도록 합니다. 이러한 적응형 접근 방식은 단일 단계 검색보다 훨씬 더 강력한 검색 성능을 제공하는 동시에, 2배 더 낮은 대기 시간으로 주요 타사 모델과 유사한 성능을 달성합니다. 온라인 강화 학습(Online Reinforcement Learning) 중에 단계 패널티를 변경함으로써 검색 품질과 추론 비용 간의 절충안(trade-off)을 명시적으로 최적화할 수 있으며, 품질-대기 시간 프런티어를 따라 서로 다른 지점에서 체크포인트를 생성하고 프로덕션 워크로드에 가장 적합한 운영 지점을 선택할 수 있습니다.

우리의 기여는 크고 끊임없이 변화하는 작업 공간에서 작동하는 Databricks의 데이터 에이전트를 위한 실용적인 검색 빌딩 블록을 제공합니다. Genie Code, Genie One 및 Genie Agents와 같은 경험은 심층적인 탐색에 과도한 시간과 노력을 들이지 않고도 올바른 테이블, 노트북, 대시보드 및 문서를 찾아내야 합니다. Adaptive Instructed-Retriever는 이러한 설정에 대해 제한된 정책을 제공합니다. 즉, 일반적인 조회에서는 빠르고 어려운 탐색 작업에서는 철저하며, 제품 대기 시간 예산 내에서 제어할 수 있습니다. 보다 광범위하게, 이러한 결과는 다단계 추론이 필요한 작업에서도 소형 특화 모델의 경쟁력을 보여줍니다. Databricks AIR를 통해 고객은 자체 도메인 및 성능 요구 사항에 맞게 특화된 모델을 맞춤 조정할 수 있습니다.

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.