주요 컨텐츠로 이동
제품

Unity AI Gateway의 스마트 라우팅: 프론티어급 품질을 구현하면서 작업당 비용은 30% 이상 절감

Databricks에서 실제 코딩 작업의 비용을 절감하기 위해 모델 및 하네스 전반에 걸쳐 태스크 인식 라우팅을 구축한 방법

작성자: 안킷 마투르, Ivan Zhou, Bryan Qiu, Rohit Agrawal, Elise Gonzales , 켈리 알바노

코딩 작업을 위한 가격 대비 성능의 최전선에는 매우 다양한 모델과 하네스가 존재합니다. 2026년에만 33개의 새로운 모델이 출시되었습니다. 이전 게시물인 Databricks 코드베이스를 기준으로 한 벤치마킹에서, 저희는 모델들이 기능 계층별로 군집을 이루고 있으며 일상적인 작업의 상당수(예: 플래그 전환, 단일 파일 수정, 범위가 명확한 버그 수정 등)에는 가장 비싼 모델이 필요하지 않다는 것을 발견했습니다.

그렇다면 개발자의 생산성을 저하시키지 않으면서 AI 코딩 비용을 줄이려면 어떻게 해야 할까요? 가장 큰 기회 중 하나는 모든 작업에 가장 성능이 뛰어나고 비싼 옵션을 기본으로 사용하는 대신, 각 작업에 적합한 모델을 매칭하는 것입니다. 저렴한 모델을 활용하는 것만으로도 50% 이상의 비용을 절감할 수 있지만, 사용자에게는 매우 버거운 일일 수 있습니다. 훌륭한 모델과 뛰어난 하네스가 급증하면서 코딩 에이전트 사용자들은 끊임없이 선택의 과부하에 직면하고 있습니다. 모든 작업에 가장 적합한 모델을 선택하느라 시간을 낭비하는 대신, 많은 사용자가 가장 성능이 뛰어난 모델을 최대 노력 수준으로 설정해 두고 그냥 넘어가곤 합니다. 사용자에게 선택을 요구하거나 엄격한 제한으로 생산성을 저해하는 대신, 저희는 혁신이 필요하다는 것을 깨달았습니다.

이것이 바로 저희가 Unity AI Gateway의 차세대 주요 비용 제어 기능인 스마트 라우팅(Smart Routing) 베타 버전을 출시하는 이유입니다. Unity AI Gateway는 기업 전체에서 AI에 액세스하고, 지출을 관리하며, 제어 정책을 적용할 수 있는 중앙 집중식 공간을 제공합니다. 스마트 라우팅은 복잡성을 기반으로 작업을 적절한 모델에 자동으로 매칭하여 지능적인 최적화를 더해줍니다. 스마트 라우팅은 Claude Code 및 Codex에서 직접 작동하므로 개발자가 이미 사용 중인 도구를 최적화할 수 있습니다.

그리고 저희는 단순한 모델 라우팅 그 이상을 지향합니다. 코딩 에이전트를 위한 메타 하네스인 Omnigent를 통해 팀은 모델과 코딩 하네스 모두에서 최적화를 수행함으로써 스마트 라우팅의 모든 이점을 활용할 수 있으며, 개발자가 직접 선택할 필요 없이 작업에 가장 적합한 조합을 제공받을 수 있습니다.

결과가 이를 증명합니다. 내부 코딩 워크로드에서 스마트 라우팅은 Opus 5와 같은 선도적인 모델의 작업당 비용의 65%만으로도 그 어떤 단일 모델보다 뛰어난 성능을 보여주었습니다. 공개 벤치마크에서 스마트 라우팅은 절반도 안 되는 비용으로 Opus 5와 대등한 성능을 기록했습니다.

저희가 배운 점은 다음과 같습니다:

  1. 가장 큰 성과는 간단한 작업에 더 저렴한 모델을 사용하는 데서 나옵니다. 저희는 내부적으로 매우 다양한 작업을 관찰할 수 있었는데, 대부분은 프리미엄 모델이 필요하지 않았습니다. 저희는 라우터가 간단한 작업에는 더 저렴한 모델을 선택하되, 프런티어 모델급 성능이 필요한 복잡한 작업은 상위 모델로 '에스컬레이션(전환)'하도록 구성했습니다.
  2. 작업 시작 시점에 제공되는 정보(설명 및 메타데이터)만 사용해도 좋은 결과를 얻을 수 있었습니다. 정답이나 테스트, 리포지토리에 대한 그 어떤 정보도 제공하지 않았음에도 스마트 라우팅은 효과적인 선택을 내릴 수 있었습니다.
  3. 작업의 복잡성을 효과적으로 파악하고 필요한 경우 에스컬레이션하는 부분에는 여전히 개선할 여지가 많습니다. 완벽한 예측 능력을 갖춘 라우터라면 저희가 소비하는 비용의 아주 일부만으로도 모든 단일 모델을 능가할 것입니다. 또한 실제 세션에서는 작업이 더 복잡해졌는지 중간에 재평가하는 것도 도움이 될 수 있습니다. 이러한 격차를 줄이는 것은 연구와 하네스 설계 모두의 과제입니다. 저희는 개선을 위해 실제 사용자 피드백으로부터 계속 배워나가야 합니다.

저희가 이를 어떻게 구축했는지 살펴보겠습니다.

지능형 모델 라우팅은 어떻게 작동하나요?

지능형 모델 라우팅은 복잡성, 기능, 비용 등의 요소를 기반으로 작업에 가장 적합한 모델을 선택합니다. 코딩 에이전트의 경우, 이러한 라우팅이 언제 일어나야 하는지가 중요한 결정 사항입니다.

라우팅에는 일반적으로 두 가지 접근 방식이 있습니다:

  1. 요청당 라우팅(Per-request routing): 특정 세션 내에서 일부 팀은 순수하게 해당 메시지의 프롬프트 복잡성을 기반으로 각 요청을 라우팅하는 방법을 탐색했습니다. 문제는 대규모 환경에서는 비용이 캐시 적중률(cache hit rate)에 의해 크게 좌우된다는 점입니다. 높은 캐시 적중률을 유지하려면 연속적인 대화 턴을 동일한 모델(그리고 현재 인기 있는 모델들의 경우 동일한 노력 수준)로 라우팅해야 합니다.
  2. 작업 인지형 라우팅(Task-aware routing): 세션 시작 시점에 작업의 복잡성을 먼저 평가한 다음, 세션이 진행되는 동안 계속 사용할 모델과 하네스를 제안합니다. 이는 캐시 적중률을 보존하고, 캐시가 만료될 때(예: 컴팩션 이벤트가 발생할 때) 필요에 따라 업그레이드 또는 다운그레이드하는 등 향후 최적화할 수 있는 기회를 제공합니다.

스마트 라우터의 작동 방식

저희는 캐시 효율성을 보존하면서 각 코딩 작업을 적절한 모델 및 하네스에 매칭하기 위해 작업 인지형 라우팅을 선택했습니다. 가장 흥미로운 문제는 작업을 시작하기 전에 작업이 얼마나 어려운지 판단하는 것입니다. 저희는 단순하게 시작하고자 했기 때문에, 현재 저희 라우터는 단일 정책을 사용하여 모든 작업에 동일한 방식으로 적용하고 있습니다.

먼저 작업을 분류합니다. 이를 위해 작업 설명을 읽고 몇 가지 의미론적 필드로 레이블을 지정하는 저렴하고 대기 시간이 짧은 모델을 사용합니다. 이 필드에는 시스템의 어느 부분이 변경되는지, 프롬프트에 어떤 코드 증거가 포함되어 있는지(코드 스니펫, 트레이스백 또는 명시적인 내용 없음), 어떻게 실패하는 것으로 보이는지, 수정 범위가 얼마나 국소적인지, 어떤 종류의 프로젝트에 속하는지 등이 포함됩니다. 라우터는 이를 바탕으로 작업 유형 제품군과 언어 제품군을 도출합니다. 프런티어 모델을 사용하면 모든 요청(비용을 절감하려는 간단한 요청까지도)에 부담이 되므로, 추출기(extractor)는 의도적으로 작고 빠르게 설계되었습니다.

그 다음, 어떤 모델 클래스가 가장 적합한지 종합적으로 판단합니다. 라우터는 기본적으로 중간 크기의 모델을 사용하며, 레이블을 기준으로 방향을 결정합니다. 작업에 프런티어 수준의 기능과 지식이 필요한 경우 더 비싼 모델로 에스컬레이션하고, 그렇지 않은 경우 더 저렴한 모델로 위임(delegating)합니다. 즉, 단일 정책으로 전체 모델 제품군을 활용할 수 있습니다.

초기 결과는 유망합니다. 외부 연구소에 공개되지 않은 자체 내부 벤치마크를 대상으로 테스트한 결과 35%의 비용 절감 효과를 확인했습니다. 저희 결과가 일반화될 수 있음을 보여주는 공개 코딩 벤치마크에서는 56%의 비용 절감을 달성했습니다. 자체 사용 사례와 디자인 파트너를 통해 더 많은 것을 배우면서 이러한 효과가 더욱 커질 것으로 기대합니다.

모델과 하네스 전반에서 코딩 작업을 어떻게 라우팅하나요?

스마트 라우팅이 라우팅 결정을 처리하지만, 그 결정을 실행에 옮길 수 있어야 합니다. 이 기능은 Claude Code 및 Codex 내부에서 기본적으로 작동하지만, 코딩 에이전트의 경우 적절한 모델뿐만 아니라 적절한 코딩 하네스까지 선택할 때 더 나은 성능을 발휘합니다. 엔지니어가 선택된 모델과 하네스를 활용할 수 있도록 지원하려면 개별 코딩 세션 상위에서 이들을 오케스트레이션하는 레이어가 필요합니다. 이것이 바로 저희가 Omnigent를 구축한 이유입니다.

스마트 라우팅은 Omnigent에서 두 가지 수준으로 구현됩니다:

첫째, Omnigent를 사용하는 개발자는 특정 코딩 하네스를 수동으로 선택하는 대신 스마트 라우팅을 선택할 수 있습니다. 그러면 Omnigent가 각 작업에 맞는 하네스와 모델을 모두 자동으로 선택하며, 이때 모델 라우팅은 Unity AI Gateway의 스마트 라우팅을 통해 구동됩니다. 이러한 설계를 통해 개발자와 관리자는 매번 클라이언트를 변경하지 않고도 조직 수준의 가이드라인이나 이전 대화 기록 사용 옵션과 같은 맞춤 설정을 자유롭게 제공할 수 있습니다.

이는 또한 모든 서브 에이전트 실행이 스마트 라우팅 API를 거치므로, 서브 에이전트가 다른 하네스와 모델을 활용할 수 있음을 의미합니다. 사용자의 초기 프롬프트는 구체적이지 않아 복잡성을 판단하기 어려운 경우가 많기 때문에, 서브 에이전트를 사용하면 새로운 정보, 신선한 캐시, 명확한 지침을 바탕으로 새로운 작업을 조정할 수 있습니다. 단일 작업 내에서도 계획 수립 및 병렬 서브 에이전트 작업 전반에 걸쳐 미세한 라우팅 결정이 이루어질 수 있으므로(예: 대규모 코드베이스 요약 작업은 더 저렴한 모델로 라우팅하고, 아키텍처 설계는 더 비싼 모델로 처리), 훨씬 더 큰 비용 절감 효과를 얻을 수 있습니다.

모델 라우팅이 잘 작동하는지 어떻게 평가할까요?

효과적인 모델 라우팅은 비용뿐만 아니라 개발자 생산성도 함께 최적화해야 합니다. 라우터는 아직 초기 단계의 기술이므로 지속적인 반복 개선이 필요하며, 따라서 피드백 신호를 확보하는 것이 매우 중요합니다. 여기서 저희의 첫 번째 단계는 나중에 평가할 수 있도록 모든 코딩 세션 트레이스를 기록하는 것이었습니다. 저희는 비용과 개발자 경험을 모두 고려하고자 합니다. 생산성을 희생하면서까지 비용만 최적화하고 싶지는 않기 때문입니다.

Unity AI Gateway를 사용하면 코딩 에이전트의 트레이스를 Unity Catalog에 기록할 수 있습니다. 이는 매우 민감한 데이터이므로, 대부분의 성숙한 기업에서는 정교한 태깅 및 액세스 정책을 통해 이를 계속 관리해야 합니다.

저희는 라우터의 변경 사항을 평가하기 위해 AI 모델과 사람의 검토를 모두 활용하여 트레이스를 분석했습니다. 라우팅을 적용하기 전에 자체 세션에서 이 분석을 실행했을 때, 단지 기본 모델이 가장 비싸다는 이유만으로 굳이 필요하지 않은 작업에 프런티어 모델 비용을 지출하는 세션이 상당수 존재한다는 사실을 발견했습니다. 실제로 라우터가 유용한지 검증하려면 다음과 같은 메트릭을 지속적으로 모니터링해야 합니다:

  • 모델별 세션 분석
  • 라우팅된 모델에 의해 처음부터 끝까지(end-to-end) 완료된 세션 수
  • 라우팅을 통해 절감된 비용(달러)

지능형 모델 라우팅의 향후 계획

저희는 이 분야에 큰 기회가 있다고 믿으며, 앞으로도 지속적으로 심도 있는 연구를 진행할 계획입니다. 아직 초기 단계이므로 배워야 할 점이 많습니다.
첫 번째 과제는 실제 사용자 행동과 일치하지 않는 신뢰할 수 없는 벤치마크 데이터였습니다. 벤치마크 작업은 이례적으로 정형화되어 있어, 각 작업이 독립적인 작업 명세서 형태로 제공됩니다. 라우터가 이러한 작업에서는 우수한 성능을 발휘하지만, 실제 세션은 전혀 그렇지 않은 경우가 많습니다.

  • 첫 번째 프롬프트가 명확한 경우는 드뭅니다. 개발자가 처음에 입력하는 내용은 구체적인 사양이라기보다는 문제의 증상이나 대략적인 의도에 가깝기 때문입니다. 하지만 라우터는 이 첫 번째 메시지를 읽고 모델을 결정해 버립니다.
  • 세션이 재사용됩니다. 따라서 첫 번째 요청에 적합했던 결정이 네 번째 요청에서는 잘못될 수 있지만, 라우터에 다시 묻는 과정이 없습니다.

이에 따라 저희는 더 많은 정보를 수집하고 새로운 기술을 시도하기 위해 몇 가지 새로운 방향을 연구하고 있습니다:

  1. 작업 범위 지정이 자유로운 곳부터 시작합니다. PR 검토, 하위 에이전트 실행, 배치 마이그레이션, 예약된 작업 등은 기계가 작업 명세서를 작성하기 때문에 처음부터 완전히 명시되어 있습니다. 라우팅은 사용자의 습관을 바꾸지 않고도 현재 이러한 클래스에서 잘 작동하므로, 저희는 이곳에 가장 먼저 배포하고 있습니다.
  2. 첫 번째 턴이 아닌 몇 번의 대화(turn)가 오간 후에 라우팅합니다. 대화형 작업의 경우, 첫 번째 프롬프트는 결정을 내리기에 가장 부적절한 순간이며, 굳이 그 시점에 결정을 내릴 필요도 없습니다. 대신 저렴한 모델이 초기 대화를 처리하고 명확한 질문을 던지게 한 다음, 작업의 윤곽이 잡히면 라우팅하는 것이 유용할 수 있습니다. 빠르고 작은 모델로 먼저 탐색하는 것이 더 좋으므로, 이를 통해 비용과 경험을 동시에 개선할 수 있습니다.
  3. 세션 크기를 줄입니다. 하나의 작업에 집중하는 세션이 라우팅도 더 잘 되고 비용도 적게 듭니다. 도구를 통해 주제가 바뀔 때 새 세션을 시작하도록 유도함으로써 이를 장려할 수 있습니다.
  4. 전환 비용을 낮춥니다. 위에서 언급한 모든 방안이 실현되려면 세션 중간의 모델 변경 비용이 저렴해야 합니다. 오늘날 캐시 히트율(cache-hit-rate)이 비용의 대부분을 차지하는 환경에서는 세션 중간에 모델을 전환하는 것이 대규모 환경에서 불가능합니다. 캐시 미스(cache miss)가 이미 발생하는 지점인 컨텍스트 압축(context compaction)이 자연스러운 연결 고리가 됩니다 (이것이 바로 Cognition의 Devin Fusion이 작동하는 방식입니다). 시간이 흐름에 따라, 저희는 라우팅 레이어가 캐시 미스 비용을 라우터 사용 방식에 내포하기보다는 명시적으로 가격을 책정하도록 만들고자 합니다.

라우팅은 보통 비용을 절감하는 방법으로 소개됩니다. 쉬운 작업에 더 낮은 비용을 지불함으로써 대부분의 이점을 얻지만, 동일한 메커니즘을 통해 더 나은 결과를 얻기 위해 언제 더 많은 비용을 지출해야 하는지 결정하는 데도 도움을 줄 수 있습니다. 가치 극대화(Valuemaxxing)는 양날의 검과 같습니다. 저렴한 모델로 충분할 때는 이를 선택하고, 가치가 보장될 때는 자신 있게 더 많은 비용을 지출하세요.

코딩 도구는 종종 사용자가 점점 더 많은 토큰을 소비하도록 유도하지만, 우리가 진정으로 원하는 것은 토큰이 아니라 달러당 생산적인 아웃풋을 최적화하는 것입니다. 충분한 상황에서 더 저렴하고 빠른 모델을 선택하는 것은 단순히 비용을 절감하는 데 그치지 않습니다. 시간도 절약할 수 있으며, 정말로 필요한 작업을 위해 희소한 프런티어 용량을 아껴둘 수 있습니다.

지금 Smart Routing을 사용해 보세요

이제 Unity AI Gateway를 통해 Smart Routing을 베타 버전으로 사용할 수 있습니다. 복잡성에 따라 코딩 작업을 적절한 모델로 자동 라우팅하므로, 모든 작업에 가장 적합한 모델을 선택하여 30% 이상의 비용 절감과 함께 프런티어 수준의 성능을 달성할 수 있습니다. 개발자의 선택권이나 생산성을 제한하지 않으면서 AI 코딩 비용을 줄이고자 하는 팀에게 Smart Routing은 수동으로 모델을 선택하거나 일률적인 지출 한도에 의존하는 방식의 훌륭한 대안이 됩니다. 또한 Omnigent를 사용하면 모델과 코딩 하네스(harness) 전반으로 지능형 라우팅을 확장할 수 있습니다.

시작하려면 문서 페이지를 방문하세요:

저희 웹사이트를 방문하여 Unity AI Gateway에 대해 자세히 알아보세요.

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.