주요 컨텐츠로 이동
플랫폼

Databricks AgentOps 빅북을 소개합니다

엔터프라이즈 규모에서 거버넌스가 확보되고 신뢰할 수 있는 AI 에이전트를 배포하는 데 필요한 인력, 프로세스 및 기술에 대한 가이드

작성자: Pavithra Rao, 진 추, Kyra Wulffert , Alex Baur

  • AgentOps는 프로덕션 환경에서 AI 에이전트를 구축, 평가, 거버넌스 및 개선하기 위한 운영 체계입니다.
  • AgentOps 빅북은 아키텍처, 평가, 관측 가능성, 비용 관리 및 이해관계자 조율에 대한 실용적인 가이드를 제공합니다.
  • 이 책은 현장에서 검증된 아키텍처, 기술적 모범 사례, 이해관계자 조율 플레이북을 결합하고 피해야 할 일반적인 함정을 짚어주는 청사진을 제공합니다.

AgentOps란 무엇인가요?

AgentOps는 프로덕션 환경에서 AI 에이전트를 구축, 배포 및 개선하기 위한 운영 체계입니다. 아키텍처, 평가, 관측 가능성(observability), 거버넌스, 보안 및 비용 관리를 팀이 반복할 수 있는 하나의 프로세스로 통합합니다.

AI 에이전트는 단순히 답변을 생성하는 모델 그 이상입니다. 에이전트는 런타임에 도구를 선택하고, 기업 데이터를 검색하고, API를 호출하며, 여러 단계로 구성된 작업을 스스로 수행할 수 있습니다. 이러한 기능 하나하나는 잘못된 도구 호출, 과도한 권한 부여, 예상치 못한 비용 급증 등 문제가 발생할 수 있는 지점이 됩니다.

AgentOps는 이러한 복잡성이 걸림돌이 되지 않도록 방지하기 위해 존재합니다. 이를 잘 수행하면 시스템을 사람들이 신뢰할 수 있을 만큼 안정적으로 만들고, 팀이 실제로 운영할 수 있을 만큼 단순하게 유지할 수 있습니다.

AI 에이전트에 AgentOps가 필요한 이유는 무엇인가요?

생성형 AI는 다른 어떤 기술 트렌드보다 빠르게 실험 단계에서 기업 환경으로 도입되었습니다. 이제 다음 과제는 유망한 파일럿 프로젝트를 사용자가 신뢰할 수 있는 시스템으로 전환하는 것입니다.

대부분의 팀은 다음과 같은 동일한 운영상의 질문에서 막히게 됩니다.

  • 에이전트가 이 작업에 대해 올바른 결과를 생성하고 있는가?
  • 에이전트가 사용한 도구와 데이터를 포함하여 수행한 작업을 추적할 수 있는가?
  • 민감한 데이터 및 작업에 대한 액세스를 어떻게 제어할 것인가?
  • 여러 번의 모델 호출, 재시도 또는 가드레일 검사가 실행될 때 요청당 비용은 얼마나 발생할 것인가?
  • 에이전트를 출시할 준비가 되었는지는 누가 결정하며, 라이브 상태가 된 후에는 누가 모니터링하는가?

이러한 질문에 답하려면 더 강력한 모델을 도입하는 것만으로는 부족합니다. 에이전트 자체를 위한 운영 모델이 필요합니다.

이는 익숙한 영역입니다. MLOps는 팀들이 머신러닝 모델을 노트북에서 벗어나 프로덕션 환경으로 이전하면서 성숙해졌습니다. 그 뒤를 이어 LLMOps가 등장하여 프롬프트 및 모델 버전 관리, 분산 서빙, 비용 제어를 위한 실무 방식을 추가했습니다. AgentOps는 그 다음 단계로, 스스로 추론하고 도구를 사용하며 행동을 취하는 시스템으로 이러한 규율을 확장합니다.

프로덕션 에이전트에는 도구가 접근할 수 있는 범위에 대한 명확한 경계, 다단계 실행에 대한 추적 가능한 기록, 품질 측정 방법, 실패 발생 시 대응 계획이 필요합니다. 또한 엔지니어링, 제품, 보안, 컴플라이언스, 재무 부서 간의 긴밀한 조율을 통해 제품 출시 시 모두가 대비할 수 있도록 해야 합니다.

고객 경험이 이를 증명합니다. FactSet의 text-to-code 지식 에이전트는 단일 파운데이션 모델에서 완전한 에이전트 시스템으로 진화하여 정확도를 44% 향상시켰습니다. FactSet 사례 읽어보기.

The Big Book of AgentOps는 기업 팀이 이러한 전환을 성공적으로 이룰 수 있도록 돕는 실무 방식을 체계화합니다. 여기에는 아키텍처 패턴, 단계별 제공 파이프라인, 평가 및 피드백 루프, 거버넌스, 비용 관리, 그리고 에이전트의 실제 프로덕션 도달 여부를 결정하는 이해관계자 의사결정 등이 포함됩니다.

The Big Book of AgentOps의 주요 내용

이 책은 총 6개의 장을 통해 개념부터 구현까지 상세히 다룹니다.

1. AI 에이전트 아키텍처의 이해

에이전트는 단순히 프롬프트와 답변으로 이루어지는 LLM 호출과는 다릅니다.

로깅, 평가 게이트, 거버넌스, 롤백, 모니터링 모두 중요하지만, 4가지 에이전트 아키텍처에 따라 요구사항이 달라집니다. 쉽게 참조할 수 있도록 각 아키텍처와 이에 해당하는 운영 요구사항을 개괄적으로 설명합니다.

또한, 파일럿의 출시를 가로막는 안티패턴(anti-pattern)을 파악하는 것도 그만큼 중요합니다. 너무 광범위한 유스케이스로 시작하는 것, 복잡성이 정당화되기 전에 멀티 에이전트 오케스트레이션을 도입하는 것, 불필요한 추론 루프를 두거나 평가를 너무 나중으로 미루는 것 등이 이에 해당합니다. 유사한 실수를 방지할 수 있도록 저희가 관찰한 흔한 안티패턴 목록을 공유합니다.

2. AI 에이전트 배포 아키텍처 패턴

배포 아키텍처는 유스케이스와 조직의 요구사항에 따라 단순한 형태부터 복잡한 형태까지 다양합니다. 단일 Databricks 워크스페이스에서의 배포부터 가장 복잡한 설정인 멀티 어카운트, 멀티 에이전트 엔터프라이즈 토폴로지에 이르기까지 4가지 배포 패턴을 다룹니다. 각 패턴에는 요구사항 변화에 따라 패턴을 선택하고 발전시키는 방법에 대한 가이드가 포함되어 있습니다. 모든 단계에서 Unity Catalog, Unity GatewayMLflow가 아키텍처 지원의 핵심 역할을 합니다.

3. AgentOps 프로젝트 라이프사이클

팀 구성 및 유스케이스 선정부터 데이터 인프라 구축, 평가 루프, 거버넌스 모범 사례에 이르기까지 7단계로 구성된 로드맵을 제시합니다.

각 단계에서 주의해야 할 중요 사항을 강조합니다. 예를 들어, 비용은 라이프사이클에서 중요한 부분입니다. 하위 에이전트, 재시도, 가드레일 검사 등을 고려하면 단 한 번의 사용자 요청으로도 여러 번의 모델 호출이 발생할 수 있습니다. 따라서 사용량을 추적하고, 한도를 설정하며, 지출에 대한 명확한 책임 소재를 파악하는 것이 매우 중요합니다.

4. AI 에이전트에 DevOps 원칙 적용하기

고품질 에이전트를 개발하려면 팀이 신속하게 반복해야 합니다. 또한 최신 연구 동향과 조직의 변화하는 요구사항에 맞춰 에이전트를 발전시켜야 합니다. 이를 해결하기 위해 The DevOps Handbook에서 발췌한 흐름(flow), 피드백, 지속적 학습의 원칙이 AI 에이전트 시스템 운영에 어떻게 유용한 기반을 제공하는지 강조합니다.

이러한 원칙을 에이전트 시스템에 적용한다는 것은 실제 추적(trace) 데이터를 기반으로 골든 평가 데이터셋을 구축하고, 도메인 전문가(SME)의 피드백을 바탕으로 자동화된 평가 모델(judge)을 보정하며, 평가 결과를 활용해 다음 개발 방향을 결정하는 것을 의미합니다. 고객 이메일 에이전트의 실제 사례를 통해 매번 출시할 때마다 수동 감사를 거치지 않고도 사람의 검토, 모델 기반 평가, 규칙 기반 검사가 어떻게 유기적으로 연동되는지 보여줍니다.

5. AI 에이전트 운영화 방법

6단계 계획 프로세스는 팀이 실제로 결과에 영향을 미치는 부분에 역량을 집중할 수 있도록 돕습니다. 즉, 사람의 워크플로우 매핑, 기술 아키텍처로의 변환, 페르소나별 관측 가능성(observability) 요구사항 정의, 시스템 내 추적(tracing) 설계, 데이터 및 도구에 대한 액세스 제어 매핑, 재사용 가능한 요소 식별 등이 포함됩니다.

통신사 고객 지원 에이전트 사례를 통해 데이터 스키마, 요금 청구 하위 에이전트가 사용할 수 있는 도구, 그리고 한 고객이 다른 고객의 데이터를 절대 볼 수 없도록 보장하는 세분화된 제어 기능에 이르기까지 이 프로세스를 실제로 어떻게 적용하는지 보여줍니다.

6. 프로덕션 AI 에이전트를 위한 이해관계자 관리

훌륭한 엔지니어링 기술이 에이전트의 성공적인 프로덕션 배포를 보장하는 것은 아닙니다. 기술적으로 완벽한 프로젝트가 사람 간의 문제로 인해 중단되는 경우가 많습니다.

프로덕션 준비 상태는 임원 스폰서와 제품 소유자(PO)부터 SME, 보안, 컴플라이언스, 재무 부서에 이르기까지 조직 전반의 이해관계자 조율에 달려 있습니다. 이 섹션에서는 가장 자주 지연되는 의사결정의 책임 소재를 명확히 하는 실용적인 RACI 매트릭스와 출시 전후 프로젝트 단계별 권장 커뮤니케이션 주기를 제공합니다. 이러한 팀 프로세스는 긴밀한 SME 피드백 루프를 보장하고, 출시 후 운영 모니터링 및 검토가 원활하게 진행되도록 하며, 프로젝트가 장기적으로 가치를 창출할 수 있도록 지원합니다.

프로덕션 AI 에이전트를 위한 AgentOps 모범 사례

단순한 AI 에이전트 아키텍처로 시작하기

오케스트레이션을 도입하기 전에 명확한 성공 지표가 있는 잘 정의된 단 하나의 유스케이스를 선택하세요. 작동하는 프로토타입을 이해관계자들에게 조기에 선보이세요. 미리 정해진 로드맵이 아니라, 프로토타입을 통해 배운 점을 바탕으로 다음 개발 단계를 결정하세요.

DXC Technology는 AI 포트폴리오를 확장하면서 이 경로를 따랐습니다. 이 기업은 현재 3개의 AI 에이전트를 프로덕션 환경에서 운영 중이며, 8개를 추가로 파일럿 또는 개발 단계에 두고 있습니다. 또한 Databricks로 마이그레이션한 후 플랫폼의 총 소유 비용(TCO)을 30% 절감했습니다. DXC Technology 사례 읽어보기.

첫날부터 AI 에이전트 평가 체계 구축하기

평가는 팀이 자신 있게 에이전트를 출시하고, 이후에도 안전하게 업데이트를 지속할 수 있도록 해주는 핵심 요소입니다. 몇 개의 엄선된 채팅 프롬프트 대신, SME가 실제 추적(trace) 데이터를 검토하는 것부터 시작하세요. 이러한 사람의 판단은 실패 모드를 드러내고, 대표성 있는 평가 세트를 구축하며, 궁극적으로 일상적인 검사를 대신할 자동화된 평가 모델(judge)을 보정하는 데 도움이 됩니다.

Databricks는 에이전트 평가, AI 지원 평가 모델, 추적 기반 분석을 플랫폼에 직접 통합하여 팀이 프로덕션 문제를 발견하고, 근본 원인을 파악하며, 재배포 전에 수정 사항을 테스트할 수 있도록 지원합니다.

Intercontinental Exchange(ICE)는 금융 데이터를 사용하여 비즈니스 질문에 답변하는 거버넌스 기반 text-to-SQL 애플리케이션에 이를 적용하여, 약 50개의 쿼리에서 77%의 구문 정확도와 96%의 실행 일치율을 달성했습니다.

AI 에이전트 관측 가능성 및 거버넌스 통합

에이전트 수가 늘어남에 따라 개별 애플리케이션 내에 존재하는 제어 기능은 감사하기가 점점 더 어려워집니다. 플랫폼 접근 방식을 사용하면 새로운 에이전트마다 거버넌스를 새로 구축할 필요 없이 데이터 액세스, 모델 및 도구 사용, 추적, 평가, 정책 적용을 한곳에서 관리할 수 있습니다.

Databricks에서 이러한 기반은 평가 및 추적을 위한 MLflow, 모델 및 도구 트래픽을 위한 Unity Gateway, 그리고 데이터 및 AI 자산 전반의 거버넌스 기반 검색, 권한, 리니지(lineage), 액세스 제어를 위한 Unity Catalog로 구성됩니다.

Block은 거버넌스가 확보된 토대가 제공하는 이점을 잘 보여주는 좋은 예시입니다. Block의 Databricks 환경은 AI 및 운영 유스케이스를 모두 지원하며, Unity Catalog를 통해 여러 사업부 간의 데이터 액세스를 관리합니다. Databricks는 판매자 운영을 위한 Block의 AI 에이전트 시스템을 통해 1,000만 달러 상당의 생산성 향상을 거두었다고 보고합니다.

추천 독자

The Big Book of AgentOps는 AI 에이전트를 프로덕션에 도입하거나, 배포된 에이전트를 안정적으로 유지 관리하는 책임을 맡은 모든 분을 위해 작성되었습니다.

  • 에이전트 시스템을 구축하고 운영하는 AI, 데이터, 소프트웨어 및 플랫폼 엔지니어
  • 결과에 책임을 지는 프로덕트 매니저 및 비즈니스 오너
  • 무엇이 '올바른 결과'인지 정의하고 실제 동작을 검토하는 SME
  • 안전한 배포를 책임지는 보안, 컴플라이언스 및 리스크 관리 팀
  • 사용량, 비용 및 규모를 추적하는 재무 및 FinOps 팀

사용자가 에이전트의 동작에 의존하는 환경에 있는 분이라면 누구나 이 책을 필독서로 소장해야 합니다.

Databricks에서 AgentOps 시작하기

eBook 전문을 읽어보고 자세한 내용을 알아보며, 프로덕션 AI 에이전트를 뒷받침하는 플랫폼 기능을 살펴보세요.

AgentOps 자주 묻는 질문

AgentOps란 무엇인가요?

AI 에이전트가 배포된 후 이를 구축, 평가, 배포, 거버넌스, 관찰 및 개선하기 위한 일련의 실천 방식이며, 시스템이 안정적으로 추론하고 도구를 사용하며 행동을 취할 수 있도록 유지하는 운영 규율입니다.

AI 에이전트에 AgentOps가 필요한 이유는 무엇인가요?

요청이 들어오고 답변이 나가는 사이에 도구 호출, 검색, 권한 확인, 재시도, 오케스트레이션 등 수많은 과정이 일어나기 때문입니다. 이러한 각 과정은 품질, 리스크, 지연 시간 또는 비용에 영향을 미치지만, 모델의 최종 출력만 모니터링해서는 이러한 과정을 전혀 파악할 수 없습니다.

The Big Book of AgentOps는 어떤 내용을 다루나요?

에이전트 환경 및 안티 패턴, 배포 아키텍처, 7단계 프로젝트 파이프라인, 평가 및 피드백 루프, 비결정론적 시스템에 맞게 조정된 DevOps 실천 방식, 영향력이 큰 계획 수립 활동, 이해관계자 관리 등을 다룹니다.

Databricks에서 AgentOps를 시작하려면 어떻게 해야 하나요?

측정 가능한 성공 기준이 있는 좁은 범위의 유스케이스를 선택하세요. 실제 사례를 바탕으로 평가 세트를 구축하고, 에이전트가 실제로 수행하는 작업을 추적하고, 최소 권한 거버넌스를 적용하고, 더 복잡한 오케스트레이션으로 확장하기 전에 운영 주기를 확립하세요.

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.