주요 컨텐츠로 이동

AIOps란 무엇인가요?

AIOps는 AI 및 머신러닝을 관측 가능성(observability)과 결합하여 IT 운영을 자동화합니다. 핵심 구성 요소, 이점, 사용 사례 및 과제를 살펴보세요.

작성자: Databricks 직원

  • AIOps(IT 운영을 위한 인공지능)는 AI, 머신러닝 및 운영 데이터를 적용하여 이상 징후를 감지하고, 이벤트를 연관 분석하며, 근본 원인을 식별하고, 인시던트 대응을 자동화합니다.
  • IT 및 플랫폼 엔지니어링 팀이 다운타임 위험을 줄이고, 경보 피로를 줄이며, 의사 결정 속도를 높이고, 평균 복구 시간(MTTR)을 단축할 수 있도록 지원합니다.
  • AIOps는 원시 시스템 신호를 실행 가능한 운영 인텔리전스로 변환하는 동시에, 위험성이 높은 작업에 대해 인간 개입(human-in-the-loop) 감독을 유지함으로써 관측 가능성(observability) 및 DevOps 관행을 보완합니다.

IT 운영을 위한 인공지능(AIOps)은 IT 운영에 AI머신러닝을 적용하여 이상 징후를 탐지하고, 이벤트를 연관 분석하며, 근본 원인을 식별하고, 그 어떤 수동 프로세스보다 빠르게 대응을 트리거합니다.

Gartner는 2017년에 이 용어를 처음 만들었습니다. 그렇다면 왜 지금 이에 대해 읽고 계실까요?

2026년에 애플리케이션을 실행하는 인프라는 기존 모니터링 도구가 설계되었던 환경과는 완전히 다르기 때문입니다. 여러분은 수백 개의 마이크로서비스, 멀티 클라우드 종속성, AI 워크로드, 그리고 대기 중인 엔지니어가 일주일 동안 읽을 수 있는 양보다 더 많은 운영 신호를 단 한 시간 만에 생성하는 에이전트 기반 시스템을 관리하고 있습니다.

바로 이 격차를 해소하기 위해 AIOps가 존재합니다. 이 가이드에서는 AIOps의 작동 방식, 적용 분야, 플랫폼을 선택하기 전에 평가해야 할 사항을 설명합니다.

  • AIOps는 IT 운영에 AI와 머신러닝을 적용하여 이상 징후를 탐지하고, 이벤트를 연관 분석하며, 예상되는 근본 원인을 식별하고, 더 빠른 장애 대응을 가능하게 합니다.
  • AIOps는 운영 데이터를 실질적인 인사이트로 전환하여 팀이 다운타임 위험을 줄이고, 알림 피로도를 낮추며, 의사 결정 속도를 높이고, 장애 대응을 가속화하도록 돕습니다.
  • AIOps는 옵저버빌리티와 DevOps를 대체하는 것이 아니라 보완하며, 위험성이 높은 작업에 대한 인간의 감독을 유지하면서 AI 및 플랫폼 엔지니어에게 운영 인텔리전스를 제공하여 역량을 강화합니다.

AIOps가 하는 일과 하지 않는 일

AIOps는 로그, 트레이스, 이벤트, 네트워크 토폴로지의 데이터를 분석하여 문제가 장애로 표면화되기 전에 이를 탐지하고 실패를 예측합니다.

image3.png
AIOps가 하는 일과 하지 않는 일

AIOps는 옵저버빌리티와 조치 사이에 위치합니다. 옵저버빌리티는 시스템 전반에서 무슨 일이 일어나고 있는지 알려줍니다. AIOps는 해당 신호를 받아 노이즈를 줄이고, 관련 이벤트를 연결하며, 플랫폼 엔지니어가 다음에 해야 할 일을 결정하도록 돕습니다. AIOps는 옵저버빌리티, DevOps 또는 인간의 판단을 대체하지 않습니다. 이 세 가지 모두를 더 빠르게 만들어 줍니다.

왜 지금일까요?

인프라가 더욱 분산됨에 따라 운영 데이터의 양, 종속성의 복잡성, 변화의 속도가 모두 증가하고 있습니다. 기존 모니터링 도구는 증가하는 요구사항을 충족하지 못하며, 위협의 우선순위를 지정할 수 있는 명확한 컨텍스트가 부족하여 과도한 노이즈를 생성하는 경우가 많습니다. 그 결과, 데이터 팀은 장애가 사용자에게 영향을 미치기 전에 중요한 신호를 식별하는 데 어려움을 겪습니다.

팀이 IT 운영에 AI와 머신러닝을 활용하면 다음과 같은 이점을 얻을 수 있습니다.

  • 다운타임 위험 감소: AIOps는 이상 징후를 탐지하고 관련 이벤트를 연관 분석하여 잠재적인 실패를 더 일찍 식별함으로써, 주요 서비스가 중단되고 다운타임이 발생하기 전에 문제를 해결하도록 지원합니다.
  • 알림 피로도 감소: 머신러닝은 반복적이거나 가치가 낮은 알림을 필터링하고, 사람의 주의가 필요할 가능성이 높은 이벤트를 표면화할 수 있습니다.
  • 의사 결정 속도 향상: AIOps는 운영 이벤트에 컨텍스트를 추가하고 예상되는 근본 원인을 식별함으로써, 엔지니어가 현재 어떤 상황이 발생하고 있으며 다음에 무엇을 조사해야 하는지 판단할 수 있도록 돕습니다.
  • 장애 대응 가속화: 적절한 조치 방법이 알려진 경우, AIOps는 서비스 재시작, 리소스 확장 또는 사전 정의된 워크플로우 트리거와 같은 작업을 권장하거나 자동화할 수 있습니다.

이러한 요인들은 특히 조기 위협 탐지와 빠른 복구에 초점을 맞추고 있습니다. 그렇다고 해서 AIOps가 모든 자동화 병목 현상을 해결하거나 엔지니어의 필요성을 없애준다는 의미는 아닙니다.

AIOps의 핵심 구성 요소는 무엇인가요?

AIOps 플랫폼을 평가할 때는 주요 빌딩 블록과 해당 도메인에서 어떻게 작동하는지 이해하는 것이 중요합니다.

  • 데이터 수집: 이 단계에서 AIOps 플랫폼은 인프라, 애플리케이션, 네트워크 장치의 메트릭, 로그, 트레이스, 이벤트, 알림 데이터를 수집하고 데이터 레이크, 데이터 웨어하우스 또는 레이크하우스로 통합합니다. 광범위하고 안정적인 데이터 수집은 AIOps가 IT 환경 전반에서 문제를 탐지하는 데 필요한 가시성을 제공합니다.
  • 데이터 정규화 및 강화: AIOps가 다양한 소스에서 데이터를 수집한 후, 분석 시스템은 원시 데이터를 처리하여 트렌드를 강조하고, 환경의 용량 요구사항을 예측하며, 시스템 장애를 일으키기 전에 비정상적인 시스템 동작을 탐지합니다. 이를 통해 다운스트림 분석 시스템은 어떤 일이 어디서 일어나고 있는지에 대한 일관된 뷰를 확보할 수 있습니다.
  • 이상 징후 탐지. 시스템에서 비정상적인 활동을 탐지하기 위해 기존 방식은 정적 임계값, CPU 제한 및 유사한 측정값에 의존하여 알림을 트리거합니다. 컨텍스트는 전혀 고려되지 않습니다. AIOps는 시간, 일, 계절별로 각 메트릭의 정상적인 동작이 어떤지 학습합니다. 그런 다음 해당 동작이 기준선에서 벗어날 때만 알림을 보냅니다. 덕분에 AI 엔지니어는 문제가 사용자에게 영향을 미치기 전에 잠재적인 문제를 조사할 수 있는 더 많은 시간을 확보할 수 있습니다.
  • 이벤트 연관 분석. 10개의 서로 다른 서버에서 높은 CPU 사용량이 표시될 때, AIOps는 각 알림을 개별적인 장애로 처리하는 대신 관련된 알림들을 서로 연결합니다. 이를 통해 알림 피로도를 줄이고 수백 개의 개별 이벤트 대신 근본적인 문제에 집중할 수 있도록 돕습니다.
  • 근본 원인 분석. 70개의 알림이 울리면 각각을 일일이 추적하는 기존 방식은 지속 가능하지 않습니다. AIOps는 시스템 토폴로지를 이해하고, 알림이 발생하는 동안 종속된 서비스를 검사하여 문제의 근본 원인을 표면화합니다. 알림을 통해 AIOps는 서비스 C의 성능이 저하되었으며, 서비스 A와 B는 단지 다운스트림에 불과하다는 것을 판단합니다. 이를 통해 문제 해결을 가속화하고, 비즈니스 다운타임을 최소화하며, 장애별 조사를 피함으로써 시간을 절약할 수 있습니다.
image5.png
AIOps의 핵심 구성 요소
  • 자동화 및 오케스트레이션. 근본 원인이 식별되면 AIOps는 서비스 재시작, 인프라 확장, 배포 롤백, 티켓 생성 등 사전 정의된 대응을 권장하거나 실행하여 이러한 인사이트를 행동으로 전환합니다. 이 구성 요소는 수동 개입을 줄이고, 장애 해결을 가속화하며, 운영 비용을 제어하는 데 도움이 됩니다. 더 고급 운영 워크플로우의 경우, Agent Bricks를 통해 팀이 기업 데이터와 도구를 사용하여 다단계 작업을 수행하는 AI 에이전트를 구축하고 배포할 수 있습니다.
  • 협업 워크플로우. AIOps 인사이트를 장애 해결을 담당하는 인력 및 프로세스와 연결합니다. 여기에는 알림 라우팅, 담당자 지정, 장애 에스컬레이션, 엔지니어가 대응하는 데 필요한 컨텍스트 제공 등이 포함될 수 있습니다.

이러한 핵심 구성 요소를 바탕으로, 다음 섹션에서 이들이 어떻게 함께 작동하는지 살펴보겠습니다.

AIOps는 어떻게 작동하나요?

AIOps 프로세스는 애플리케이션, 인프라, 네트워크, 클라우드 서비스로부터 신호를 수집하는 것부터 시작합니다. 그런 다음 데이터 정제 과정을 거쳐 중복되거나 불완전하거나 일관되지 않은 신호를 AIOps가 분석할 수 있는 형식으로 정리합니다.

예를 들어, 시스템이 애플리케이션에서 갑자기 다량의 API(Application Programming Interface) 오류를 반환하기 시작하는 것을 감지했다고 가정해 보겠습니다. AIOps는 애플리케이션의 현재 동작을 이전 패턴과 비교하고 오류 증가를 비정상적인 현상으로 표시합니다.

이벤트 연관 분석을 통해 AIOps 플랫폼은 API 오류를 데이터베이스 부하의 갑작스러운 증가나 최근 배포와 같은 다른 신호와 연결합니다. 그런 다음 예상 원인 분석을 통해 이러한 연결된 신호를 검사하여 발생 가능한 원인을 파악합니다. AIOps는 API 오류, 데이터베이스 부하, 배포를 별개의 이벤트로 처리하는 대신, 최근 배포를 해당 장애의 유력한 원인으로 식별합니다.

마지막 단계는 안내형 또는 자동화된 대응입니다. 워크플로우에 따라 AIOps는 조치 방법을 권장하거나, 티켓을 생성하거나, 해당 팀에 알림을 보내거나, 배포 롤백과 같이 사전 정의된 대응을 자동으로 실행할 수 있습니다.

위험성이 높은 작업의 경우, 엔지니어가 운영 환경에 영향을 미치기 전에 대응 조치를 검토하고 승인할 수 있도록 human-in-the-loop 방식을 요구해야 합니다.

AIOps의 주요 유형에는 어떤 것이 있나요?

AIOps의 유형은 조직에 가장 적합한 방식, 운영 범위, 관리할 시스템, 인프라의 상호 연결 수준에 따라 달라집니다.

도메인 중심(domain-centric) 및 도메인 무관(domain-agnostic) 접근 방식은 AIOps의 두 가지 주요 유형입니다. 어느 한쪽이 다른 쪽을 직접 대체할 수는 없으며, 각각의 강점과 트레이드오프가 존재합니다.

도메인 중심 AIOps는 클라우드 관리, 네트워크 성능 또는 애플리케이션 모니터링과 같은 특정 영역에 초점을 맞춥니다. 도메인 중심 접근 방식은 특정 도메인의 문제를 해결하는 데 매우 유용하며, 해당 환경 내에서 더 깊은 컨텍스트와 보다 전문화된 분석을 제공합니다.

image1.png
도메인 무관 및 도메인 중심 AIOps

도메인 무관 AIOps는 애플리케이션, 네트워크, 클라우드 인프라, 스토리지와 같은 시스템에서 데이터를 수집하고 분석하여 여러 IT 환경에서 작동합니다. 도메인 중심 접근 방식과 달리, 도메인 무관 AIOps 플랫폼은 더 광범위한 문제를 해결하는 데 가장 적합합니다. 따라서 인시던트가 운영 경계를 넘나드는 경우가 많은, 복잡하고 서로 연결된 인프라를 관리하는 조직에 더 적합합니다.

도메인 중심 AIOps는 단일 도메인 내에서 더 깊이 있고 더 전문화된 인텔리전스를 제공할 수 있는 반면, 도메인 무관 AIOps는 시스템과 도구 전반에 걸쳐 더 넓은 범위와 광범위한 가시성을 제공합니다.

일반적인 AIOps 사용 사례

AIOps 사용 사례는 IT 운영의 많은 영역에 걸쳐 있으며, 가장 일반적인 애플리케이션은 다음과 같습니다.

근본 원인 분석

AIOps는 중단, 오류 또는 성능 문제의 예상 원인을 정확히 찾아내는 데 도움이 됩니다. API 오류의 급증을 단일 인시던트로 취급하는 대신, AIOps는 이를 최근 배포, 데이터베이스 장애 또는 네트워크 구성 변경과 연관시킬 수 있습니다.

이상 탐지

AIOps는 시스템 데이터를 지속적으로 스캔하여 기준선을 설정하고 인시던트 및 장애로 이어질 수 있는 편차를 탐지합니다.

성능 모니터링

AIOps는 상호 연결된 서비스 및 종속성이 있는 클라우드, 온프레미스 및 하이브리드 환경 전반에서 IT 환경을 모니터링할 수 있습니다. 이를 통해 지속적인 모니터링과 성능 상관관계를 통해 트렌드를 파악하고 문제의 우선순위를 정할 수 있습니다.

클라우드 도입 및 마이그레이션

클라우드 마이그레이션은 워크로드, API, 서비스 및 인프라 전반에 걸쳐 새로운 종속성을 발생시킵니다. AIOps는 이러한 관계를 매핑하고, 시스템 동작의 변화를 모니터링하며, 중요한 서비스가 중단되기 전에 잠재적인 병목 현상을 식별합니다. AIOps는 마이그레이션 중에 하이브리드 및 멀티클라우드 환경에 대한 더 명확한 가시성을 제공합니다.

DevOps 도입

DevOps는 개발 및 배포 속도를 높이지만, 사람이 감지하지 못할 수 있는 운영 위험과 문제도 초래합니다. AIOps는 배포 활동을 모니터링하고 프로덕션에 미치는 영향을 분석하며, 문제가 발생할 때 사전 정의된 응답을 트리거할 수 있습니다.

AIOps와 DevOps는 소프트웨어 제공 및 운영 라이프사이클의 서로 다른 부분을 다루며, 통합될 때 더 효과적입니다.

보고서

멀티 에이전트 시스템, AI 활용 사례, 평가 등 주요 인사이트

AIOps 대 DevOps: 차이점은 무엇인가요?

이는 AIOps와 DevOps 중 하나를 선택하는 문제가 아니라, AIOps와 DevOps를 함께 사용하는 것에 대한 이야기입니다. 두 접근 방식은 경쟁하기보다 서로를 보완합니다. DevOps는 소프트웨어를 빌드, 테스트 및 배포하기 위한 운영 모델을 제공하는 반면, AIOps는 이를 실행하는 시스템에 운영 인텔리전스를 적용합니다.

image4.png
DevOps 대 AIOps

DevOps는 소프트웨어 제공을 자동화하는 동시에 개발자가 변경 사항을 더 빠르게 릴리스할 수 있도록 하여 개발과 운영을 연결합니다. AIOps는 인프라, 애플리케이션 및 기타 시스템의 데이터를 분석하여 이상을 탐지하고, 이벤트를 연관시키고, 예상 원인을 식별하고, 더 빠른 복구를 지원함으로써 해당 운영 모델을 확장합니다.

 DevOpsAIOps
주요 초점소프트웨어 제공 및 협업IT 운영 및 운영 인텔리전스
역할운영 모델 및 엔지니어링 관행AI 기반 분석 및 자동화
분석 대상코드, 빌드, 테스트, 배포메트릭, 로그, 추적, 이벤트 및 알림
주요 결과더 빠르고 안정적인 릴리스더 빠른 탐지, 대응 및 복구
협업 방식변경 사항을 프로덕션에 제공운영에 미치는 영향을 모니터링하고 이에 대응

DevOps가 새로운 애플리케이션 버전을 배포하는 동안 AIOps는 프로덕션에 미치는 영향을 모니터링할 수 있습니다. 배포 시 비정상적인 동작이 나타나면 AIOps는 신호를 연관시키고, 예상 원인을 식별하며, 사전 정의된 응답을 트리거하거나 담당 엔지니어에게 알릴 수 있습니다. 이 두 가지가 함께 작동하면 명확한 가시성을 바탕으로 더 빠르게 움직일 수 있습니다.

AIOps의 이점은 무엇인가요?

AIOps의 주요 이점은 더 빠른 MTTR, 운영 비용 절감, 더 나은 관찰 가능성 및 협업, 그리고 보다 예측 가능한 ITOps 관리입니다. 각 이점은 플랫폼 엔지니어가 인시던트를 탐지, 이해 및 해결하는 방식과 직접적으로 연결됩니다.

  • 더 빠른 MTTR: AIOps는 수동 조사보다 빠르게 이벤트를 연관시키고, 예상되는 근본 원인을 식별하며, 다음 조치를 추천할 수 있습니다. 이를 통해 엔지니어가 인시던트를 추적하는 데 소비하는 시간을 줄이고 영향을 받는 서비스를 더 빨리 복구할 수 있습니다.
  • 운영 비용 절감: AIOps는 반복적인 탐지, 조사 및 복구 작업을 자동화하여 성장하는 IT 환경을 관리하는 데 필요한 수동 노력을 줄여줍니다. 또한 문제가 확대되기 전에 식별함으로써 비용이 많이 드는 다운타임을 방지하는 데 도움이 됩니다.
  • 더 나은 관찰 가능성 및 협업: AIOps는 인프라, 애플리케이션 및 기타 운영 시스템의 신호를 시스템 상태에 대한 공유 뷰로 가져옵니다. 이를 통해 개발, 보안 및 IT 운영 팀은 인시던트를 조사하고 대응을 조정할 때 더 나은 컨텍스트를 확보할 수 있습니다.
  • 예측 가능한 ITOps 관리: AIOps는 과거 및 실시간 운영 데이터를 사용하여 향후 장애나 용량 문제를 나타낼 수 있는 패턴을 식별합니다. 데이터 팀은 이러한 위험의 우선순위를 정하고 큰 인시던트가 되기 전에 조치를 취할 수 있습니다.

이러한 결과는 AIOps 플랫폼이 수신하는 신호의 품질, 운영 프로세스의 명확한 소유권, 기존 워크플로와의 통합에 따라 달라집니다. 이러한 요소가 갖춰지지 않으면 AIOps는 인시던트 대응을 개선하지 못한 채 더 많은 노이즈와 자동화만 추가할 수 있습니다.

조직에 AIOps를 통합해야 하는 이러한 이유에도 불구하고 여전히 고려해야 할 몇 가지 제약 사항이 있습니다.

AIOps의 한계는 무엇인가요?

AIOps는 여러 측면에서 한계가 있습니다. 그 효과는 데이터의 품질, 모델이 사용할 수 있는 컨텍스트, AI 엔지니어가 권장 사항을 기존 워크플로에 통합하는 방식에 따라 달라집니다.

  • 데이터 품질 격차: 로그, 메트릭, 추적, 이벤트 및 기타 소스의 불완전하고 일관되지 않거나 노이즈가 많은 데이터는 부정확한 상관관계, 누락된 이상 현상 또는 불필요한 알림을 생성할 수 있습니다.
  • 컨텍스트 누락: 종속성, 최근 배포, 구성 또는 비즈니스 영향에 대한 사전 정보가 없는 운영 신호는 AIOps가 원인이나 심각도를 올바르게 이해하지 못한 채 이상 현상을 식별하도록 만들 수 있습니다.
  • 모델 드리프트: 과거 패턴으로 학습된 모델은 시스템, 워크로드 및 운영 기준선이 변경됨에 따라 정확도가 떨어질 수 있으므로 지속적인 모니터링과 조정이 필요합니다.
  • 과도한 자동화 위험: 적절한 안전장치가 마련되지 않은 상태에서 복잡한 복구 단계를 완전히 자동화할 수는 없습니다. 그렇게 하면 작은 인시던트가 더 큰 인시던트로 번질 수 있습니다. 위험성이 높은 작업은 사람이 계속 감독해야 합니다.
  • 도구 난립: 파편화된 모니터링 및 관찰 가능성 스택에 또 다른 AIOps 플랫폼을 추가하면 복잡성이 더 커질 수 있습니다.
  • 낮은 신뢰도 또는 도입률: 엔지니어는 이해하거나 검증할 수 없는 권장 사항에 의존할 가능성이 낮습니다. 데이터 팀은 중요한 운영 전반으로 AIOps를 확장하기 전에 명확한 소유권, 설명 가능한 권장 사항, 측정 가능한 결과가 필요합니다.

데이터 팀과 AI 엔지니어는 이러한 한계를 알아야 합니다. 한계를 알면 기대치를 설정하고 거버넌스 및 위험 관리 전략을 더 효과적으로 준비하는 데 도움이 되기 때문입니다.

Unity Catalog는 단일 카탈로그에서 이러한 거버넌스 전략과 데이터 및 AI 자산에 대한 액세스를 제공하여 팀이 민감하고 규제 대상인 데이터에 대한 액세스를 제어할 수 있도록 지원합니다.

조직에서 AIOps를 구현하려면 어떻게 해야 하나요?

조직이 IT 운영에 AIOps를 구현할 때, 이는 한 번에 모든 것을 바꾸는 '빅뱅' 방식의 전환이 아니라 점진적인 과정이라는 점에 유의하는 것이 중요합니다. 즉, 단계별로 도입하고, 가치를 검증하고, 시스템에 대한 신뢰를 구축하면서 확장해 나가는 순차적인 진행에 초점을 맞추는 것을 의미합니다.

알림 피로(alert fatigue)를 줄이거나 장애 대응을 개선하는 등, AIOps가 측정 가능한 이점을 제공할 수 있고 영향력이 큰 운영 문제부터 시작하세요.

관련된 운영 시그널을 통합하고, 종속성 및 시스템 동작에 대한 컨텍스트를 추가한 후, AIOps가 위험성이 높은 작업을 자동화하도록 허용하기 전에 권장 사항을 제안하는 것부터 시작하세요. Databricks에서 에이전트 기반 운영 워크플로를 구축하는 팀은 Agent Bricks를 사용하여 에이전트를 구축 및 배포하고, 추적 및 평가를 위해 MLflow를 사용하고, 거버넌스가 적용된 액세스를 위해 Unity Catalog를 사용하고, 모델 및 도구 트래픽 제어를 위해 Unity Gateway를 사용할 수 있습니다.

팀이 권장 사항을 신뢰하기 시작하면 워크플로를 실무에 적용하고 MTTR, 알림 볼륨, 장애 빈도와 같은 메트릭을 정의하여 영향을 측정합니다. 거기서부터 조직은 기존 도구, 프로세스 및 소유권에 대한 변경 사항을 관리하면서 다른 시스템으로 AIOps를 확장할 수 있습니다.

Mosaic AI가 조직의 운영 전반에서 AI를 관리하고 거버넌스를 적용하는 데 어떻게 도움이 되는지 확인해 보세요.

AIOps의 다양한 접근 방식에는 어떤 것이 있나요?

조직의 인프라와 프로세스에 도메인 중심(domain-centric) 또는 도메인 무관(domain-agnostic) AIOps 접근 방식 중 어느 것이 더 적합한지 결정하려면 범위, 깊이, 통합, 설정 노력, 적합성을 고려하세요.

  • 범위(Coverage): 하나의 운영 도메인에 AIOps가 필요한가요, 아니면 여러 팀, 시스템, 환경에 걸쳐 필요한가요?
  • 깊이(Depth): 팀에 특정 도메인을 위한 전문화된 인텔리전스가 필요한가요, 아니면 서로 연결된 시스템 전반에 걸친 광범위한 분석이 필요한가요?
  • 통합(Integrations): 이 접근 방식이 기존의 모니터링, 관측 가능성(observability), 클라우드 및 IT 운영 도구와 연결될 수 있나요?
  • 설정 노력(Setup effort): 배포, 구성 및 유지 관리에 얼마나 많은 시간과 운영 노력이 소요되나요?
  • 조직 적합성(Organizational fit): 팀의 기술, 기존 워크플로, 소유권 모델 및 운영 목표와 일치하나요?

이러한 질문을 신중하게 검토하고 답해 보면 팀이 어떤 접근 방식을 취해야 할지에 대한 더 나은 의사 결정 모델을 얻을 수 있습니다. 올바른 선택은 귀사의 운영 요구 사항에 부합하는 선택입니다.

다음 단계

AIOps는 AI 및 머신러닝을 운영 데이터에 적용하여 문제를 더 일찍 감지하고, 그 영향을 이해하며, 더 빠르게 대응합니다. 이는 엔지니어와 기존의 관측 가능성 및 IT 운영 프로세스를 대체하기보다는 이를 보강하는 인텔리전스 레이어로서 가장 잘 작동합니다.

이상 감지, 원인 분석, 장애 대응, 성능 모니터링 등 AIOps가 가장 큰 가치를 제공할 수 있는 영역을 식별하는 것부터 시작하세요. 그런 다음 사용 가능한 데이터와 통합을 평가하고, 위험성이 높은 자동화를 구현하기 전에 권장 사항을 도입하고, 알림 볼륨 및 운영 비용과 같은 핵심 메트릭에 미치는 영향을 측정하세요.

에이전트 기반 및 대규모 언어 모델(LLM) 애플리케이션을 구축하고 관리하려면, MLflow를 탐색하여 애플리케이션 수명 주기와 운영 워크플로를 어떻게 지원할 수 있는지 알아보세요.

자주 묻는 질문

AIOps는 무엇의 약자인가요?

AIOps는 Artificial Intelligence for IT Operations(IT 운영을 위한 인공지능)의 약자입니다. AI, 머신러닝, 운영 데이터를 사용하여 IT 문제를 감지, 조사 및 대응합니다.

AIOps는 어떤 데이터를 사용하나요?

AIOps는 로그, 메트릭, 추적(trace), 이벤트, 알림, 구성 데이터 및 IT 시스템의 기타 시그널을 포함한 운영 데이터를 분석할 수 있습니다.

AIOps는 관측 가능성(observability)과 어떻게 다른가요?

관측 가능성은 시스템 전반에서 일어나는 일을 수집하고 이해합니다. AIOps는 이러한 운영 시그널을 기반으로 AI 및 머신러닝을 적용하여 이벤트를 연관시키고, 이상을 감지하고, 가능성 높은 원인을 식별하며, 대응을 지원하거나 자동화합니다.

AIOps는 MLOps와 어떻게 다른가요?

AIOps는 IT 운영에 AI와 머신러닝을 적용하는 반면, MLOps는 머신러닝 모델과 그 수명 주기를 개발, 배포, 모니터링 및 관리하는 데 중점을 둡니다. 이 둘은 서로 다른 운영 문제를 해결하지만, 대규모 ML 시스템을 운영하는 조직에서는 겹치는 부분이 있을 수 있습니다.

AIOps는 도구인가요, 아니면 실천 방식인가요?

AIOps는 실천 방식이자 도구의 범주이기도 합니다. 실천 방식으로서의 AIOps는 IT 운영에 AI와 머신러닝을 적용하는 것을 포함하며, AIOps 플랫폼은 이러한 실천 방식을 지원하는 데 필요한 데이터 처리, 분석, 연관성 분석 및 자동화 기능을 제공합니다.

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.