주요 컨텐츠로 이동
AI Engineering

프론티어 데이터 에이전트가 품질과 비용 측면에서 범용 코딩 에이전트보다 우수한 성능을 발휘하는 이유

실제 내부 세션에서 추출한 400개 이상의 작업을 바탕으로 Genie Code를 업계 최고의 코딩 에이전트 3개와 비교 평가합니다.

작성자: Databricks AI 연구팀

  • Genie Code는 기본적인 데이터 분석부터 워크스페이스 전반의 데이터 탐색, 파이프라인 구축, 장애 디버깅, 대시보드 배포와 같은 데이터 엔지니어링 작업에 이르기까지 모든 범위의 데이터 작업을 지원하는 Databricks의 데이터 에이전트입니다.
  • 실제 내부 사용 사례에서 추출한 400개 이상의 작업 전반에서 Genie Code는 테스트한 에이전트 중 가장 정확하면서도 가장 저렴했으며, 다른 에이전트 비용의 절반도 안 되는 비용으로 정확한 답변을 제공했습니다.
  • 엔터프라이즈 컨텍스트에 대한 깊은 시맨틱 이해 덕분에 Genie Code는 다른 에이전트의 오류와 높은 비용을 유발하는 무차별 대입 방식의 스키마 탐색을 건너뛸 수 있어, 훨씬 더 낮은 비용으로 더 정확한 답변을 도출합니다.

에이전트 AI 분야의 통념에 따르면 더 나은 답변에는 더 많은 토큰이 소요됩니다. 즉, 에이전트가 더 오래 탐색하고, 더 많이 검증하고, 더 많이 재시도할수록 정확도는 항상 올라간다는 것입니다. 내부 사용 사례에서 추출한 400개 이상의 실제 데이터 작업에서 Genie Code를 업계 최고의 범용 코딩 에이전트 3개와 직접 비교 평가했을 때, 저희는 정반대의 결과를 발견했습니다. Genie Code는 테스트한 에이전트 중 가장 정확하면서도 가장 비용 효율적이었습니다.

Genie Code, 400개 이상의 실제 데이터 작업에서 코딩 에이전트 능가


그 이유는 데이터 에이전트가 범용 코딩 에이전트가 어려움을 겪는 새로운 패러다임에서 작동해야 하기 때문입니다. 이전에 공유해 드린 것처럼, 데이터 에이전트는 고유한 과제에 직면해 있습니다. 수십만 개의 테이블, 노트북, 대시보드, 문서가 있는 동적이고 끊임없이 진화하는 워크스페이스에서 올바른 자산을 찾아내야 하고, 오래되거나 모순될 수 있는 메타데이터와 문서 전체에서 단일 진실 공급원(source of truth)을 결정해야 하며, 코딩 에이전트가 의존하는 검증 가능한 테스트 없이 이 모든 작업을 수행해야 합니다.

이러한 문제를 해결하기 위해 저희는 Genie Code에 범용 코딩 에이전트가 의존하는 무작위 탐색(random walk)을 건너뛸 수 있는 기능을 제공했습니다. 카탈로그 및 워크스페이스 자산에 대한 시맨틱 검색, 사용자가 신뢰하는 테이블 및 비즈니스 로직에 대한 영구 메모리, 엔터프라이즈 컨텍스트에 대한 깊은 시맨틱 이해 등이 이에 해당합니다.

이번 평가 세션에서 이러한 차이를 직접 확인할 수 있었습니다. 일례로, Genie Code는 시맨틱 검색과 메타데이터를 활용하여 올바른 테이블을 효율적으로 찾고, 단 하나의 SQL 쿼리를 작성하여 단 5번의 도구 호출만으로 정확한 답변을 도출한 반면, 3개의 범용 에이전트는 탐색 단계에서 벗어나지 못했습니다.

무작위 탐색을 건너뛰는 Genie Code

아래에서는 다양한 실제 사용자 작업에서 Genie Code를 어떻게 평가했는지 자세히 살펴보겠습니다.

실제 사용 사례에서 추출한 400개 이상의 실제 작업으로 에이전트를 평가했습니다

저희는 Genie Code의 실제 사용자 작업의 광범위한 분포를 포괄하도록 평가 세트를 의도적으로 구성했습니다. 일상적인 질문부터 파워 유저가 다루는 더 까다로운 문제에 이르기까지 Databricks 내부의 실제 사용 사례에서 401개의 독립적인 작업을 추출했습니다. 여기에는 에이전트가 올바른 자산을 찾아야 하는 탐색 작업, 코드 및 쿼리 생성 및 수정, 코드 디버깅, 기존 코드 이해 및 설명, 테이블에서 정확한 숫자를 추출해야 하는 정밀한 데이터 조회 등이 포함됩니다.

평가 작업 분포

저희는 Genie Code와 업계 최고의 범용 코딩 에이전트 3개(각각 Agent X, Agent Y, Agent Z로 명명)에 동일한 작업을 실행했으며, 각 작업당 20분의 실제 실행 시간 제한을 동일하게 부여했습니다. 답변은 독립적인 평가단이 답변의 정확성과 유용성을 기준으로 채점했습니다. 시간 초과(timeout)된 작업은 실패로 간주되었습니다. 이 분석에 표시된 달러 수치는 사용자가 각 에이전트에 지불할 비용에 대한 추정치이며, 상대적인 관점에서 비교할 때 더 유용한 정보를 제공합니다.

결과

모든 에이전트가 유사한 프론티어 수준의 LLM을 사용하고 Databricks MCP로 보강된 상태에서, 401개의 모든 작업에 대해 각 에이전트를 실행했습니다.

에이전트

정확도

작업당 평균 비용($)

Genie Code

76.6%

$0.55

Agent X

72.1%

$1.09

Agent Y

55.9%

$0.91

Agent Z

56.1%

$1.16

다른 에이전트 비용의 약 절반 수준인 Genie Code

Genie Code는 이 벤치마크에서 가장 정확하면서도 가장 저렴한 에이전트입니다. 작업당 비용은 Agent X의 약 절반 수준이며, 정답당 비용은 절반도 되지 않습니다. Agent Y와 Z는 정확도가 50%대 중반에 머물렀는데, 이는 주로 매우 큰 테이블에 대한 비효율적이고 제한 없는 쿼리로 인해 장시간 실행되는 스캔에서 시간 초과가 발생했기 때문입니다.

이 특정 벤치마크의 경우, 작업 비용의 중앙값은 $0.34, p99는 $2.72, 가장 비용이 많이 든 작업은 $3.87이었으며, $2를 초과한 작업은 4%에 불과했습니다. 다른 에이전트들은 작업의 33~40%에서 $1를 초과한 반면(Genie Code는 16%), Agent X의 심층 탐색 실행은 최대 $9.49라는 훨씬 더 높은 비용을 기록했습니다. 모든 에이전트가 동일한 등급의 프론티어 수준 모델을 사용하므로, 비용 차이는 결국 효율성, 즉 답변에 도달하기 위해 더 적은 턴을 거치고 더 적은 토큰을 소비하는지 여부에서 비롯됩니다.

전체 작업 분포 전반에서 효율성을 유지하는 Genie Code

이러한 격차는 각 에이전트가 필요한 데이터를 찾는 방식에서 발생합니다. 이 세트에서 가장 어려운 작업들은 자산 이름을 명시적으로 지정하지 않으므로, 에이전트가 답변을 하기 전에 관련 비즈니스 로직과 함께 올바른 테이블, 노트북 또는 대시보드를 찾아내야 합니다. 이러한 작업에서 범용 에이전트들은 비효율적인 워크스페이스 탐색에 의존하게 되며, 이로 인해 정확도는 낮아지고 비용은 높아집니다.

카탈로그에 대한 시맨틱 검색 및 워크스페이스 데이터에 대한 영구 메모리와 같은 Genie Code의 워크스페이스 컨텍스트 이해 덕분에 이러한 탐색 과정을 대부분 건너뛸 수 있었으며, 작업당 평균 도구 호출 횟수는 테스트한 에이전트 중 가장 적은 8.3회에 불과했습니다. 앞서 언급한 비용의 꼬리(tail) 부분도 이와 관련이 있습니다. 모든 에이전트의 고비용 실행은 이러한 탐색 작업이 지배적이었으며, Genie Code의 꼬리가 가장 짧았습니다. 저희는 이러한 강점이 Genie Ontology를 통해 더욱 강화될 것으로 기대합니다. 이번 실행에서는 아직 모든 고객에게 글로벌하게 제공되지 않아 Ontology를 비활성화했습니다.

결론

조사를 시작할 때 저희는 정확도와 비용 사이에 트레이드오프(상충 관계)가 있을 것으로 예상했습니다. 대신, 광범위한 실제 사용자 작업 분포 전반에서 Genie Code가 데이터에 대한 강력한 시맨틱 이해를 바탕으로 범용 코딩 에이전트보다 더 정확하고 저렴하게 우수한 성능을 발휘할 수 있음을 확인했습니다.

Genie Code는 Databricks 워크스페이스와 같이 매우 동적이고 모호한 환경에서 작동하도록 최적화된 프론티어 데이터 에이전트로 구축되었습니다. 범용 코딩 에이전트는 이러한 환경에서 어려움을 겪으며, 결국 Genie Code가 이미 가지고 있는 컨텍스트를 다시 찾아내느라 턴과 토큰을 낭비하게 됩니다. 이러한 전문성은 범용 기능의 저하 없이 정확도, 속도, 비용 절감이라는 시너지 효과로 이어집니다.

마지막으로, Databricks 코드베이스에 대한 코딩 에이전트 벤치마크와 마찬가지로, 일반적인 리더보드가 사용자의 일상적인 경험을 측정할 수는 없다는 더 광범위한 교훈을 얻었습니다. 저희는 실제 작업을 기반으로 매일 평가를 확장하고 있으며, 앞으로도 학습한 내용을 계속해서 공유할 예정입니다.

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.