주요 컨텐츠로 이동

데이터 온톨로지 정의: AI 에이전트가 놓치고 있는 컨텍스트 레이어

Databricks의 제품 마케팅 디렉터 Richard Tomlinson이 '온톨로지'라는 용어가 왜 실시간으로 재정의되고 있는지, 그리고 온톨로지가 채워주는 공백이 왜 AI 에이전트가 신뢰할 수 있는 답변을 얻기 위해 해결해야 할 유일한 과제인지 설명합니다.

작성자: 리처드 톰린슨

  • 엔터프라이즈 데이터 아키텍처는 항상 데이터와 의사 결정 사이에 지식 있는 인간이 존재하여 스키마가 제공할 수 없는 맥락을 제공한다고 가정해 왔습니다. AI 에이전트는 이러한 인간을 배제하며, 이로 인해 이 가정은 무너집니다.
  • 시맨틱 레이어와 지식 그래프가 이전에 이를 해결하려고 시도했으나, 기업 전체를 수동으로 모델링하는 것은 비즈니스의 빠른 변화 속도를 따라갈 수 없기 때문에 결국 사용되지 않고 방치되는 경우가 많았습니다.
  • 해결책은 더 방대한 문서화 프로젝트가 아닙니다. 틀려서는 안 되는 소수의 핵심 개념을 규율하고, 나머지는 조직이 이미 작동하는 방식에서 지속적으로 학습하는 온톨로지입니다. 이것이 바로 Databricks가 Genie Ontology에 구축한 모델입니다.

한 회사에서 다섯 명에게 "매출"이 무엇을 의미하는지 물어보면 다섯 가지의 서로 다른 답변을 얻을 가능성이 있으며, 각 답변은 자체 컨텍스트 내에서는 맞지만 다른 답변과는 호환되지 않을 수 있습니다. 인간 분석가가 그 모호함과 최종 보고서 사이에서 조율을 해온 덕분에 지금까지는 이러한 모호함을 관리할 수 있었습니다. 이는 일종의 암묵지(tribal knowledge)로, 유능한 분석가라면 그냥 직관적으로 알고 있는 영역입니다.

AI 에이전트는 이를 알지 못합니다. 바로 그것이 문제입니다.

Richard Tomlinson은 스키마에 명확히 드러나지 않는 엔터프라이즈 데이터 계층에 대해 오랫동안 고민해 왔습니다. 이번 대화에서 그는 이 계층인 온톨로지(ontology)가 왜 갑자기 대부분의 기업이 아직 구축하지 못한 가장 중요한 인프라가 되었는지, 이전 세대의 구축 시도들이 왜 대부분 중단되었는지, 그리고 에이전트가 온톨로지에 의존하기 시작할 때 온톨로지가 제대로 작동하려면 무엇이 전제되어야 하는지 설명합니다.

AI 에이전트에게 스키마가 제공할 수 없는 비즈니스 컨텍스트가 필요한 이유는 무엇인가요?

AI 에이전트가 소리 없이 깨뜨리고 있는 엔터프라이즈 데이터에 대한 가정은 무엇인가요?

Richard Tomlinson: 수십 년 동안 엔터프라이즈 데이터 아키텍처는 데이터를 올바르게 정리하기만 하면 지능적인 사용자가 그 의미를 파악할 수 있다는 암묵적인 가정 하에 작동해 왔습니다. 테이블, 스키마, 카탈로그, 대시보드는 구조를 제공하고, 인간은 누락된 컨텍스트를 채워줍니다. 분석가는 재무팀이 신뢰하는 5개의 매출 테이블 중 어느 것인지, 이번 분기의 "활성 고객"이 무엇을 의미하는지, 또는 왜 다른 계산법 대신 특정 계산법을 사용해야 하는지 알고 있습니다.

AI 에이전트는 데이터와 의사 결정 사이에 지식을 갖춘 인간이 개입하지 않을 수 있기 때문에 이 가정을 깨뜨립니다. 에이전트는 스스로 의미를 찾아내야 합니다. 에이전트에게 더 많은 데이터에 대한 액세스 권한을 부여하는 것만으로는 이 문제가 해결되지 않습니다. 에이전트에게는 과거에 인간이 머릿속에 담고 있었던 비즈니스 컨텍스트, 즉 정의, 관계, 계산법, 신뢰할 수 있는 소스, 전문 지식 및 권한이 필요합니다. 그렇기 때문에 엔터프라이즈 컨텍스트가 데이터 자체만큼이나 AI 아키텍처에서 중요해지고 있습니다.

데이터 온톨로지란 무엇이며, 스키마와는 어떻게 다른가요?

데이터 온톨로지를 어떻게 정의하시나요? 그리고 스키마가 결코 담아낼 수 없는 어떤 것을 온톨로지는 포착하나요?

Richard Tomlinson: 스키마는 데이터가 어떻게 구조화되어 있는지를 설명합니다. 반면 온톨로지는 비즈니스 컨텍스트에서 그 데이터가 무엇을 의미하는지를 설명합니다. 온톨로지는 테이블, 메트릭, 쿼리와 같은 기술적 자산을 비즈니스 개념(정의, 관계, 계산법, 전문 지식의 원천, 이러한 개념을 해석하는 방법에 대한 규칙 등)과 연결합니다.

스키마는 에이전트에게 테이블에 net_rev, gross_rev, recog_rev가 포함되어 있다고 알려줄 수 있습니다. 온톨로지는 질문에 어떤 매출 정의가 적용되는지, 재무팀이 어떤 소스를 신뢰할 수 있다고 판단하는지, 계산이 보통 어떻게 수행되는지, 질문한 사람에게 액세스 권한이 있는지 등을 에이전트가 이해하도록 도울 수 있습니다. 스키마가 데이터의 지도라면, 온톨로지는 조직이 그 데이터를 어떻게 이해하고 사용하는지에 대한 지도에 가깝습니다.

시맨틱 레이어와 지식 그래프가 확장하는 데 어려움을 겪은 이유는 무엇인가요?

수년 전 시맨틱 레이어와 엔터프라이즈 지식 그래프는 "단일 진실 공급원(one version of the truth)"을 약속했지만 대부분 사용되지 않고 방치되었습니다. 온톨로지가 동일한 운명을 겪지 않으려면 무엇이 전제되어야 할까요?

Richard Tomlinson: 저는 그 전제를 조금 완화하고 싶습니다. 시맨틱 레이어와 지식 그래프는 특히 비즈니스에 중요한 개념에 대해 실제 가치를 제공해 왔습니다. 문제는 조직이 전체 엔터프라이즈를 수동으로 모델링하려고 할 때 발생합니다. 비즈니스 지식은 너무 빠르게 변하고 너무 많은 곳에 분산되어 있습니다. 중요한 로직은 대시보드, SQL 쿼리, 노트북, 티켓에 있을 수도 있고, 단순히 팀이 반복적으로 작업하는 방식에 있을 수도 있습니다. 어떤 중앙 팀도 그 모든 것을 문서화하고 최신 상태로 유지할 수는 없습니다.

더 확장 가능한 모델은 "머리를 모델링하고 꼬리를 학습하는 것(model the head and learn the tail)"입니다. 인간은 매출, 규정 준수 규칙, 핵심 KPIs와 같이 절대 틀려서는 안 되는 소수의 개념들을 명시적으로 정의하고 거버넌스를 적용해야 합니다. 더 광범위한 온톨로지는 조직이 운영되는 방식으로부터 롱테일(long tail)을 지속적으로 학습하는 동시에, 권위 수준에 따라 지식의 순위를 매기고 거버넌스를 준수해야 합니다. 온톨로지를 유지 관리하는 일이 별도의 엔터프라이즈 데이터 모델링 프로젝트가 되어 버린다면, 결국 온톨로지는 설명해야 할 비즈니스의 변화 속도를 따라잡지 못하게 될 것입니다.

AI 에이전트에게 비즈니스 컨텍스트가 부족하면 어떤 일이 발생하나요?

에이전트가 실제 비즈니스 컨텍스트가 부족하여 확신에 찬 틀린 답변을 내놓았던 순간을 설명해 주실 수 있나요? 어떤 점 때문에 사람들이 거의 믿을 뻔할 정도로 설득력이 있었나요?

Richard Tomlinson: 저희 내부 테스트의 한 예로, 여러 AI 시스템에 곧 열릴 제품 자문 위원회(Product Advisory Board)를 위한 브리핑 자료를 준비하도록 요청한 적이 있습니다. 한 어시스턴트는 거의 즉시 세련된 보고서를 작성하여 24명의 고객이 참여하고 있다고 명시했습니다. 임원 브리핑에서 기대할 만한 세부 정보들이 포함되어 있어 첫눈에는 답변이 신뢰할 만해 보였습니다. 저희가 시스템에 24라는 숫자가 어디서 나왔는지 설명하라고 요구하자, 시스템은 이를 지어냈다고 인정했습니다.

이것이 바로 위험한 실패 모드입니다. 답변이 터무니없어 보이지 않습니다. 유창하고 구체적이며 합법적인 정보와 함께 제시됩니다. 문제는 모델이 어떤 내부 소스에 실제 진실(ground truth)이 포함되어 있는지 알지 못하기 때문에 추론으로 그 공백을 메운다는 점입니다. 엔터프라이즈 AI에서는 그럴듯한 답변이 답변이 전혀 없는 것보다 더 위험할 수 있습니다.

우리 조직에 컨텍스트 계층이 누락되었는지 어떻게 알 수 있나요?

데이터 리더가 자신의 조직에 이러한 문제가 있는지 알고 싶다면 무엇을 확인해야 할까요? 컨텍스트 계층이 누락되었음을 나타내는 신호가 있을까요?

Richard Tomlinson: 가장 명확한 신호는 간단한 비즈니스 질문에 대해 데이터를 통해 답을 얻기 전에 지식을 갖춘 사람이 이를 번역해야 하는 경우가 얼마나 자주 발생하는지입니다. 누군가 "지난 분기 매출이 얼마였죠?"라고 물었을 때 분석가가 즉시 "어떤 매출이요?" 또는 "어느 사업 부문이요?"라고 반문한다면, 그 번역 단계가 바로 비즈니스 컨텍스트입니다. 분석가들이 어떤 대시보드를 신뢰해야 하는지, 어떤 테이블이 더 이상 사용되지 않는지(deprecated), 또는 한 팀이 다른 팀과 비교하여 어떤 정의를 사용하는지 알고 있는 경우도 마찬가지입니다.

다른 신호로는 중복된 대시보드, 상충되는 KPI 정의, 분석가들이 동일한 질문에 반복해서 답변하는 것, 그리고 서로 다른 도구가 서로 다른 답변을 반환하여 비즈니스 사용자가 셀프 서비스를 신뢰하지 못하는 것 등이 있습니다. 근본적인 문제는 대개 회사에 데이터가 부족해서가 아닙니다. 데이터를 해석하는 데 필요한 지식이 AI가 안정적으로 사용할 수 있는 컨텍스트 계층이 아니라, 암묵지, 단절된 아티팩트, 개별 전문가의 머릿속에 존재하기 때문입니다.

보고서

멀티 에이전트 시스템, AI 활용 사례, 평가 등 주요 인사이트

오늘날 비즈니스 컨텍스트의 누락은 기업에 어떤 비용을 초래하나요?

에이전트를 대규모로 배포하기 전인 오늘날에도 기업은 이로 인해 어떤 비용을 치르고 있나요? 의사 결정 지연, 분석가의 중복 작업, 대시보드에 대한 신뢰 저하 등인가요?

Richard Tomlinson: 위에 언급된 모든 것입니다. 조직은 이미 "컨텍스트 세금(context tax)"을 지불하고 있습니다. 분석가들은 정의를 다시 찾아내고, 신뢰할 수 있는 소스를 찾고, 상충되는 보고서를 조정하며, 조직의 다른 곳에 존재하는 비즈니스 로직을 설명하는 데 시간을 허비합니다. 서로 다른 팀이 서로 다른 BI 도구 내에서 동일한 의미 체계(semantics)를 재창조합니다. 질문이 미묘해지는 순간 셀프 서비스가 작동을 멈추기 때문에 비즈니스 사용자는 분석가를 기다려야 합니다.

AI는 이 기존 문제를 더욱 가시화합니다. 컨텍스트가 없으면 에이전트는 스키마 탐색, 문서 읽기, 쿼리 시도, 가정 재고 등 동일한 탐색 프로세스의 상당 부분을 컴퓨터 연산으로 반복하게 됩니다. 이는 올바른 답변을 보장하지 않으면서 추가적인 지연 시간(latency), 토큰 소비 및 비용을 초래합니다. 하지만 더 큰 비용은 바로 신뢰입니다. 대시보드나 AI 어시스턴트가 확신에 찬 태도로 잘못된 숫자를 생성할 수 있다는 사실을 사용자가 알게 되는 순간, 그들은 다시 인간에게 질문하는 방식으로 돌아갑니다.

AI 에이전트가 단순히 보고하는 것을 넘어 행동하도록 신뢰할 수 있게 되면 무엇이 달라지나요?

에이전트가 단순히 보고하는 것을 넘어 행동하도록 신뢰할 수 있게 되는 순간, 비즈니스에는 어떤 변화가 생길까요?

Richard Tomlinson: AI의 가치가 극적으로 변화합니다. 보고는 누군가가 답을 찾는 데 필요한 시간을 절약해 줍니다. 신뢰할 수 있는 행동은 워크플로우에서 전체 단계를 제거할 수 있습니다. 에이전트는 누군가가 매 단계마다 수동으로 지시하지 않아도 최신 숫자를 계산하고, 주간 비즈니스 검토를 준비하고, 이상 징후를 조사하고, 티켓을 업데이트하고, 적절한 사람에게 연락하는 프로세스를 매주 월요일마다 반복할 수 있습니다.

이는 전문 지식의 경제학도 변화시킵니다. 재무 전문가, 제품 관리자 또는 운영 리더는 중요한 방법론을 한 번 인코딩한 다음, 이를 더 광범위한 비즈니스 컨텍스트를 이해하는 에이전트와 결합할 수 있습니다. 그러면 그들의 전문 지식은 개인이 직접 지원할 수 있는 것보다 훨씬 더 많은 의사 결정과 워크플로우에 적용될 수 있습니다. 여기서 핵심 수식어는 "신뢰할 수 있는"입니다. 자율성은 에이전트가 비즈니스를 충분히 이해하고 적절한 경계 내에서 행동하도록 엄격하게 제어(governed)될 때만 유용해집니다.

데이터 온톨로지 구축을 시작하는 올바른 방법은 무엇인가요?

또 다른 방치형 프로젝트(shelfware initiative)로 이어지게 만드는 잘못된 시작 방식(본능적인 실수)과 올바른 첫 단계는 각각 무엇인가요?

Richard Tomlinson: 잘못된 본능은 "AI를 사용하기 전에 전체 엔터프라이즈를 모델링해야 한다"는 생각입니다. 이는 비즈니스 컨텍스트를 수년이 걸리는 문서화 프로젝트로 만들어 버립니다. 모든 용어, 관계, 규칙이 모델링될 때쯤이면 모델의 상당 부분이 이미 구식이 되어 버립니다.

더 나은 접근 방식은 이미 가지고 있는 지식에서 시작하는 것입니다. 중요한 KPI 및 비즈니스 정의와 같이 절대 틀려서는 안 되는 소수의 핵심 개념에 거버넌스를 적용하고, 더 광범위한 컨텍스트 레이어가 팀에서 이미 생성하고 있는 대시보드, 쿼리, 노트북, 문서 및 운영 활동으로부터 학습하도록 하세요. AI가 유용해지기 전에 비즈니스의 모든 것을 문서화하도록 요구하지 마세요. 실제 사용 사례를 통해 에이전트가 사용하는 비즈니스 이해를 구축하고 지속적으로 개선할 수 있도록 하세요.

데이터 리더는 AI 에이전트를 위한 데이터 아키텍처를 어떻게 재고해야 할까요?

이제 구조뿐만 아니라 컨텍스트가 투자할 가치가 있는 대상이 된 상황에서, 데이터 리더는 데이터 아키텍처에 대해 어떻게 다르게 생각해야 할까요?

Richard Tomlinson: 수년 동안 데이터 아키텍처는 데이터를 액세스 가능하고 신뢰할 수 있으며 거버넌스가 적용된 상태로 만드는 데 크게 집중해 왔습니다. 이러한 요소는 여전히 필수적이지만, AI는 또 다른 요구사항을 추가합니다. 즉, 아키텍처가 비즈니스 의미도 액세스 가능하게 만들어야 한다는 점입니다. 에이전트는 데이터가 어디에 있는지뿐만 아니라 조직이 이를 어떻게 해석하는지, 어떤 관계가 중요한지, 어떤 정의가 권위 있는지, 그리고 이를 뒷받침하는 증거가 무엇인지도 알아야 합니다.

이는 이전에는 주로 거버넌스나 분석 인프라로 여겨졌던 자산이 전략적 AI 자산이 됨을 의미합니다. 지표 정의, 문서화, 리니지(lineage), 인증, 사용 패턴 및 비즈니스 용어집은 모두 함께 AI에게 회사가 어떻게 작동하는지 가르쳐 줍니다. 따라서 새롭게 등장하는 아키텍처는 단순히 데이터 플레인에 AI 모델을 더한 것이 아닙니다. 여러 에이전트와 애플리케이션에 동일한 비즈니스 이해를 제공할 수 있는 공유 컨텍스트 레이어도 필요합니다.

데이터 온톨로지가 실제로 에이전트의 정확도를 향상시키나요?

Richard Tomlinson: 온톨로지 자체만으로는 에이전트를 마법처럼 정확하게 만들지 못합니다. 정확도를 높이는 것은 에이전트가 추론하는 시점에 올바르고 권위 있는 컨텍스트를 제공하는 것입니다. 온톨로지가 에이전트에게 어떤 정의가 적용되는지, 신뢰할 수 있는 데이터가 어디에 있는지, 어떤 관계나 계산이 중요한지 알려줄 수 있다면, 에이전트는 추측하거나 잘못된 경로를 탐색하는 데 시간을 덜 쓰게 됩니다.

우리는 Databricks의 Genie One 및 Genie Agents의 기반이 되는 자동 컨텍스트 레이어인 Genie Ontology를 통해 그 효과를 확인했습니다. 28개의 실제 엔터프라이즈 데이터 분석 질문을 사용한 Databricks 내부 벤치마크에서, 온톨로지를 적용한 Genie는 첫 번째 시도에서 84.5%를 정확하게 답변했습니다. 동일한 평가에서 가장 강력한 범용 코딩 에이전트는 52.4%를 기록했습니다. 또한 Genie는 해당 에이전트보다 약 두 배 빨랐습니다. 이는 보편적인 정확도 보장이라기보다는 내부 벤치마크 결과이지만, 모델에 단순히 추론할 시간을 더 주는 것만큼이나, 혹은 그 이상으로 더 나은 엔터프라이즈 컨텍스트가 중요할 수 있다는 핵심 원칙을 보여줍니다.

처음부터 정식 온톨로지를 구축해야 하나요?

Richard Tomlinson: 아닙니다. 그렇게 요구한다면 우리가 해결하려는 확장성 문제가 다시 발생할 것입니다. 대부분의 기업은 이미 방대한 양의 비즈니스 이해를 구축해 두었습니다. 이는 지표 정의, 인증된 데이터, 대시보드, 쿼리, 노트북, 문서 및 팀이 이러한 자산을 반복적으로 사용하는 방식에 이미 존재합니다.

목표는 가장 중요한 개념에 대한 인간의 통제력을 유지하면서 롱테일(long tail)의 상당 부분을 자동으로 학습하는 것이어야 합니다. Genie Ontology를 사용하면 중요한 KPI와 비즈니스 용어를 명시적으로 모델링하는 동시에, 추론된 레이어가 기존 작업에서 추가적인 정의, 규칙, 관계 및 권위 있는 소스를 학습하게 됩니다. 별도의 온톨로지 프로젝트가 끝나기를 기다리는 대신, 조직이 이미 가지고 있는 지식에서 가치를 얻을 수 있습니다.

온톨로지 기반 AI 에이전트에서 거버넌스는 어떤 역할을 하나요?

거버넌스는 온톨로지 기반 에이전트에 어떻게 부합하나요?

Richard Tomlinson: 거버넌스에는 두 가지 역할이 있습니다. 명백한 첫 번째 역할은 액세스 제어입니다. 온톨로지가 기존 권한을 우회하는 뒷문이 되어서는 안 됩니다. 사용자가 소스 정보에 액세스할 수 없다면, 에이전트도 해당 정보에서 파생된 컨텍스트를 검색할 수 없어야 합니다. Genie Ontology를 사용하면 Unity Catalog를 포함한 기본 소스의 거버넌스를 사용하여 검색 중에 권한이 적용됩니다. 따라서 두 명의 직원이 동일한 질문을 하더라도 각자 볼 수 있도록 승인된 권한에 따라 서로 다른 답변을 적절하게 받게 됩니다.

두 번째 역할도 마찬가지로 중요합니다. 거버넌스는 AI가 무엇을 신뢰해야 하는지 이해하도록 돕습니다. 인증, 권위 있는 정의, 리니지, 사용량, 전문 지식 및 소스 출처는 공식 매출 정의와 누군가 6개월 전에 만든 일회성 계산을 구분하는 데 도움이 되는 신호가 됩니다. AI 시대에 거버넌스는 더 이상 데이터 제어에만 국한되지 않습니다. 거버넌스는 어떤 비즈니스 지식이 권위를 가질 만한지 AI에게 가르치는 메커니즘의 일부가 되어가고 있습니다.

데이터 온톨로지가 AI 인프라가 되고 있는 이유는 무엇일까요?

"온톨로지"라는 단어는 과거에 시맨틱 모델링 팀과 분류 체계(taxonomy) 논쟁의 전유물이었습니다. 하지만 이제는 인프라에 더 가까운 무언가로 빠르게 변모하고 있습니다. 즉, 에이전트의 답변이 비즈니스의 실제 작동 방식을 반영하는지, 아니면 그럴듯하게 포장된 추측에 불과한지를 결정하는 레이어가 되고 있습니다. 컨텍스트를 한 번 문서화하고 방치하는 것이 아니라, 거버넌스를 적용하고 지속적으로 학습해야 하는 대상으로 취급하는 조직만이 단순히 보고하는 것을 넘어 신뢰하고 행동을 맡길 수 있는 에이전트를 확보하게 될 것입니다.

Genie Ontology가 어떻게 비즈니스의 실제 의미에 기반하여 AI 답변을 제공하는지 확인해 보세요. Genie 알아보기.

다음 읽을거리:

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.