주요 컨텐츠로 이동
제조

생산 라인을 위한 에이전트: 실시간으로 신뢰할 수 있는 의사결정

운영 기술(OT) 데이터를 Databricks로 스트리밍함으로써 복합 AI 에이전트가 단순한 모니터링을 넘어 추론, 최적화, 자문 역할을 수행하는 방법을 알아봅니다.

작성자: Mohammad Khelghati

  • 몇 시간이 아닌 단 몇 분. 포장 라인에 장애가 발생하면 일분일초가 중요합니다. OEE가 10포인트 하락하면 일반적인 CPG 기업은 연간 수천만 유로의 손실을 입습니다. 이는 교대 근무당 한 시간도 채 되지 않는 시간입니다. 생각할 여유가 많지 않습니다. 라인 관리자는 후속 장비의 가동이 중단되기 전에 복구 결정을 내려야 합니다. ProdLine CoPilot은 Databricks Data Intelligence Platform에서 실시간 상태를 읽어 다음 날 아침이 아닌, 해당 교대 근무 시간 내에 즉각적인 해답을 제공합니다.
  • 통합 데이터 코어. Zerobus는 OT 원격 측정 데이터를 Delta 테이블로 스트리밍하고, MES, ERP, LIMS는 Unity Catalog 아래에서 통합됩니다. 도메인 전문가는 실시간 공장 상태를 읽고, 계획 수립자가 이미 사용하는 것과 동일한 제약 조건 하에서 실제 솔버(Monte Carlo, MILP, Bayesian, Pareto)를 호출합니다.
  • 팀이 주도권을 유지합니다. 권장 사항은 작업 지시서 초안, 보류 및 일정 메모 형태로 제공됩니다. 라인 관리자, 품질 책임자, 유지보수 담당자가 이를 승인합니다. 모든 결정은 처음부터 끝까지 추적 가능합니다.

요약

오전 9시 14분, 교대 근무 중간. 필러(주입기)가 멈춥니다. 라인 관리자에게 주어진 시간은 몇 시간이 아니라 단 몇 분뿐입니다. 곧 후속 장비의 원료가 고갈되기 시작할 것입니다. 작업자들은 기계적으로 무엇을 해야 할지 이미 잘 알고 있습니다. 시간이 더 걸리는 문제는 바로 계획과 관련된 질문들입니다. 이번 교대 근무 목표를 여전히 달성할 수 있을까? 나중에 가동 속도를 높이는 것이 더 저렴할까, 아니면 연장 근무를 요청하는 것이 더 저렴할까? 이전에도 이 라인에 동일한 결함이 발생한 적이 있었나? 그때 이전 교대 조는 어떻게 복구했을까?

이 세 가지 질문에 답할 수 있는 데이터는 이미 존재하며, PLC, SCADA, MES, ERP, LIMS 등에 흩어져 있습니다.

ProdLine CoPilot은 바로 이 짧은 골든타임을 위해 구축되었습니다. 이 시스템은 Databricks Data Intelligence Platform에서 실시간 상태를 읽고, 질문을 도메인 전문가에게 전달하며, 기본 수학적 연산(일정 복구, 고갈, 품질 리스크)을 실행합니다. 제시되는 계획은 비용, 연장 근무, 서비스 간의 트레이드오프를 균형 있게 고려한 1,000개의 일정 시나리오를 테스트하여 도출됩니다. 라인 관리자가 선택하면, 시스템이 승인을 위한 산출물(작업 지시서, 보류, 일정 노트)의 초안을 작성합니다.

진짜 문제: 데이터는 풍부하지만 인사이트는 빈약함

일반적인 CPG 포장 라인(병입, 통조림, 스낵, 화장품)에는 15~20대의 기계가 있습니다. 필러나 라벨러가 멈추면 버퍼는 몇 분밖에 버티지 못하며, 곧 라인 공급이 중단되고 생산량은 설계 용량보다 훨씬 아래로 떨어집니다. 세계 최고 수준의 OEE는 85%에 육박하지만, 많은 공장은 70% 초중반에 머물러 있습니다. 주 5일 24시간 가동 일정에서 시간당 500케이스를 생산하고 케이스당 마진이 10유로라고 가정할 때, OEE 1포인트의 가치는 연간 약 30만 유로에 달합니다. 한 라인에서 10포인트의 격차를 줄이면 수백만 유로를 절감할 수 있으며, 수십 개의 라인이 있는 공장 전체로 확장하면 그 효과는 빠르게 누적됩니다.

이 격차를 줄이기 위한 데이터는 이미 존재합니다:

  • PLC 및 SCADA는 초 미만의 정밀도로 원격 측정 데이터를 스트리밍합니다.
  • MES는 모든 미세 정지, 주요 정지, 보류 및 교체 기록을 보유합니다.
  • ERP는 재고 및 일정을 관리합니다.
  • LIMS는 품질 결과를 관리합니다.

이러한 시스템들은 서로 통신하지 않습니다. 그리고 답을 필요로 하는 사람들(라인 관리자, 교대 조장, 계획 수립자)은 대개 SQL을 작성할 줄 모릅니다.

패턴은 익숙합니다. 먼저 교대 근무 종료 보고서가 작성되고, 다음 날 아침 분석가가 쿼리를 실행한 후, 사건 발생 24시간이 지나서야 RCA 회의가 열립니다. 그 와중에 복구 결정(속도 조절, 연장 근무, CIP)은 이미 교대 근무 중에 내려진 상태입니다.

OT 데이터를 Databricks로 스트리밍하는 것은 단순히 대시보드를 업그레이드하는 것이 아닙니다. 하나의 거버넌스가 적용된 레이크하우스에서 OT를 MES, ERP, LIMS와 결합해야만 에이전트가 실시간 상태를 분석하고, 실제 제약 조건 하에서 최적화하며, 사후 대응이 아닌 교대 근무 중에 실시간으로 권장 사항을 제시할 수 있습니다.

실시간 스트리밍: 아침 보고서에서 근무 중 실시간 신호로

과거에는 공장 데이터를 이동하기 위해 Kafka급 배관(브로커, 파티션, 컨슈머 그룹)을 구축해야 했습니다. Zerobus Ingest는 이를 대체합니다. 이는 푸시 기반이자 서버리스 방식입니다. gRPC 또는 REST 호출을 보낼 수 있는 모든 장치(PLC 게이트웨이, historian 커넥터, 에지 박스)는 Unity Catalog Delta 테이블에 행을 저장할 수 있습니다.

브로커도, 파티션도 필요 없습니다. 더 많은 연결을 열어 확장하기만 하면 됩니다. 이를 Lakeflow Spark Declarative Pipelines 및 원격 측정, 품질 신호, 이벤트, 재고를 위한 표준 Bronze, Silver, Gold 메달리온 레이아웃과 결합해 보세요.

MES, ERP, LIMS는 초 미만 단위의 OT 데이터보다 느린 주기(미러, 배치 또는 CDC)로 유입되지만, 별도의 데이터 웨어하우스가 아닌 하나의 거버넌스가 적용된 카탈로그 아래 OT 테이블과 함께 배치됩니다.

데이터가 입력되면 동일한 테이블이 SQL, Genie, AI Search, Model Serving 및 에이전트에 데이터를 공급하며, Unity Catalog 아래에서 계보를 공유합니다. 예측 신호, 일정 복구 및 다운스트림 분석은 모두 이 거버넌스가 적용된 테이블을 읽으므로, 새로운 기능이 추가될 때마다 자체 복사본을 프로비저닝하는 대신 기존 복사본을 대상으로 작업하게 됩니다.

Zerobus + Delta는 Unity Catalog의 거버넌스 하에 한 자릿수 초 단위의 대기 시간으로 실시간에 가까운 수집을 처리합니다. 이 데모의 실시간 UI를 위해 프로듀서는 Lakebase에도 직접 데이터를 씁니다. 이는 장기적인 패턴이 아니라 현재 실시간 느낌을 주기 위한 지름길입니다. 동일한 Delta 테이블의 밀리초 단위 읽기 작업은 Databricks의 레이크하우스 기반 실시간 웨어하우스인 Lakehouse//RT가 처리하게 됩니다.

왜 Databricks인가

많은 공장에서 보고서 작성과 모델 실행을 서로 다른 곳에서 처리하므로, 생산 라인 자체의 데이터가 시스템 전반에서 여러 버전의 진실로 나뉘게 됩니다. 이러한 단절은 근무 시간 중 작동하는 코파일럿의 성능을 저하시킵니다.

  • 시스템 간에 데이터가 전달될 때마다 대기 시간이 누적됩니다.
  • 팀은 추출된 데이터를 정렬하기 위해 데이터 조정 비용을 치러야 합니다.
  • 데이터 소스 간에 권한 설정이 일치하지 않게 됩니다.

Databricks의 레이크하우스는 이 세 가지 지점 모두에서 단절을 해결합니다. 데이터의 단일 복사본(워크로드별로 별도 추출하는 것이 아닌 클라우드 스토리지의 오픈 Delta)만 존재합니다. 거버넌스는 Unity Catalog 내의 해당 복사본에 적용되므로, 분석가의 권한과 에이전트의 권한이 동일한 소스에서 부여됩니다. 또한 스트리밍, SQL, AI, 서빙이 모두 단일 기반 위에서 실행되므로 아침 보고서와 실시간 화면에 동일한 숫자가 표시됩니다.

전문가와 최적화 도구는 파이프라인이 유지 관리하는 것과 동일한 거버넌스 테이블을 읽습니다. 별도의 AI 데이터베이스는 존재하지 않습니다.

생산 라인 에이전트 시스템의 구조

오케스트레이터

오케스트레이터는 시스템의 관문입니다. 자연어 질문을 수락하고, Unity Catalog에서 현재 상태(기계, 이벤트, 일정, 재고, 품질, 제약 조건)를 로드한 다음, 사용자의 의도를 적절한 전문가에게 라우팅합니다.

모든 호출은 LLM이 시작되기 전에 최신 UC 상태를 읽습니다. 시스템은 권장 사항을 제시하고 산출물(티켓, 승인서, 교대 근무 노트)의 초안을 작성합니다. 실제 실행 권한은 라인 관리자, 품질 및 유지보수 담당자에게 유지됩니다.

단기 대화 메모리는 Lakebase에 저장되고, 과거 인시던트 코퍼스는 AI Search에 저장됩니다. Model Serving은 모델을 서빙하고 MLflow는 모든 호출을 추적합니다.

하나의 거대한 에이전트 대신 전문가 명단을 사용하는 이유

하나의 범용 에이전트는 문제를 지나치게 단순화하거나 초점을 잃기 쉽습니다. 다운타임 RCA, 재고 및 일정 계산에는 서로 다른 데이터와 수학적 연산이 필요합니다. 전문가 명단을 구성하면 각 프롬프트를 좁게 유지하고 각 도구를 질문에 맞게 타겟팅할 수 있습니다.

예를 들어, Downtime Analyst는 재고 테이블에서 컨텍스트를 낭비하지 않으며, Schedule Optimizer는 Quality Specialist처럼 원시 품질 검사 행을 가져오지 않습니다.

전문가역할
Downtime Analyst근본 원인 분석, 기계 간 연쇄 효과, 복구 우선순위 지정, 이벤트 + 센서 데이터 활용
Quality Specialist주입, 토크, 라벨, 케이스 중량에 대한 SPC, 보류/출고, 베이지안 리스크 분석
Supply Chain Advisor수십 개의 라인 입력값(예: 라벨, 필름, 마개, 접착제, 공정 화학 물질) 분석 — 소모율, 고갈, 재주문 긴급도
OEE Coach가동률/성능/품질 손실 분석, 파레토 분석, 트렌드 파악을 위한 Genie 활용
Schedule OptimizerMILP / 확률적 복구 계획 수립, 비용, 일정/서비스 리스크, 처리량 간의 트레이드오프 조정
Maintenance Predictor이상 징후 감지(Z-score, IQR), RUL 스타일 신호 분석, PM 트레이드오프 조정
Strategic Advisor다중 교대 근무 트렌드 분석, 개선 로드맵 수립, capex/opex 프레임워크 구축, 벤치마킹
Shift Briefing교대 전 회의 / 교대 후 인수인계 브리핑, Genie 친화적이며 모바일 우선인 요약 기능 제공

전문가들이 실제로 호출하는 도구

전문가들은 고정된 소수의 도구 세트를 호출합니다. SQL Query 및 Genie Space는 조직의 다른 부서와 동일한 방식으로 거버넌스가 적용된 읽기 작업을 수행합니다. Calculator는 Databricks SQL의 원격 측정 데이터를 기반으로 Python(NumPy 및 Pandas)에서 OEE, 복구 및 고갈 수학 연산을 실행합니다. Anomaly Detector는 해당 테이블에서 직접 롤링 윈도우를 통해 Z-score 및 사분위수 범위(IQR)를 실행합니다. Plan & Constraints는 라인별 속도 제한, CIP 기간, 교체 규칙 및 연장 근무 정책을 보유합니다. Similar Cases는 Databricks AI Search에서 과거 인시던트를 검색합니다.

단순한 채팅이 아닌 실제 솔버로의 라우팅

많은 제조업용 코파일럿은 단순한 LLM 래퍼에 불과합니다. ProdLine은 자연어를 통해 실제 솔버(운영 연구 팀이 사용하는 솔버)로 라우팅합니다.

최적화 도구방법해결 과제
Schedule RecoveryMILP (OR-Tools SCIP)속도, OT, CIP — 모호한 휴리스틱이 아닌 명시된 모델 하에서 최적의 해 도출
Stochastic ScheduleSAA + 시나리오OEE / 미세 정지 변동성 전반에 걸친 견고한 계획 수립
Production ForecastMonte Carlo (예: 1,000개 경로)이력을 기반으로 한 P10/P50/P90 완료 범위 예측
Quality RiskBayesian CPT리스크 점수 + 요인 분석
OEE Loss AnalysisPareto규모 / ROI 기준 손실 순위 지정
Multi-Shift Planner순차적 최적화교대 근무 간 속도, OT, CIP, PM 조율
RUL Estimator추세 외삽PM 타이밍 트레이드오프 조정

Human-in-the-loop: 추가 작업 없이 루프 닫기

사람의 최종 승인 없이는 아무것도 실행되지 않습니다. 라인 관리자는 복구를 담당하고, 품질 부서는 보류 및 해제를 담당하며, 유지보수 부서는 작업 지시서를 담당합니다. 핵심은 스프레드시트, 무전기, 대시보드 사이를 오가는 인지적 부하를 줄이는 것이지, 생산 관리자를 없애는 것이 아닙니다.

1분 이내에 세 가지 질문에 답해야 합니다. 현재 무슨 일이 일어나고 있는지, 현실적인 옵션은 무엇인지, 그리고 각 옵션을 선택했을 때 처리량, 초과 근무, 품질 및 서비스 측면에서 어떤 비용이 발생하는지입니다.

승인 게이트(설계 기준):

역할승인 대상
라인 관리자복구: 속도, 초과 근무, 일정
품질 부서보류/해제, 편차
유지보수 부서작업 범위 및 타이밍

현재 데모는 추론 및 추천 루프를 다룹니다. 다음 단계는 시스템 라이트백(write-back)을 통해 루프를 완성하는 것이며, 이는 자동 제어가 아닌 초안 형태로 설계되었습니다.

CMMS로의 인계는 플래너가 일정을 잡을 수 있도록 진단된 결함, 권장 범위, 목표 시간, 필요한 부품이 포함된 초안 작업 지시서 형태로 이루어집니다. 품질의 경우, QMS 및 LIMS가 품질 책임자가 검토하고 처리할 사전 작성된 편차 기록(로트, 장비, 샘플 ID, 심각도, 권장 처리 방식)을 수신합니다. MES 및 advanced planning and scheduling (APS) 시스템은 속도 조정, 초과 근무, 순서 변경 및 복구 근거가 포함된 초안 일정 업데이트를 가져와 교대 근무 실행을 위해 다시 라이트백합니다.

추적성도 동일한 로드맵을 따릅니다. 각 추천은 입력값, 가정, 제약 조건, 승인자 및 결과를 엔드투엔드로 저장하여 교대 근무 간의 인계와 지속적인 개선을 지원합니다.

파일럿 라인에서 멀티 플랜트로 확장

멀티 플랜트 롤아웃에서 가장 어려운 부분은 AI가 아니라 데이터입니다. 공장마다 자체 장비, SOP 및 LIMS 스키마가 있습니다. 두 번째 공장을 병렬 프로젝트가 아닌 시너지 효과를 내는 추가 프로젝트로 만드는 것은 그 아래에 있는 스트리밍 레이어 덕분입니다. 각 공장은 전용 네임스페이스 아래에 자체 테이블과 Genie Space를 두고 동일한 Zerobus 패턴, 메달리온 레이아웃 및 Unity Catalog 거버넌스를 기반으로 구축됩니다.

최적화 도구는 매개변수화된 상태를 유지합니다. line_constraints 테이블이 속도 범위, 초과 근무 제한, CIP 윈도우 및 전환(changeover)을 제어하므로 데이터를 변경하면 동작이 변경되며 재배포가 필요하지 않습니다.

동일한 기반을 통해 다음 유스케이스를 지원할 수 있습니다. 에너지 및 지속 가능성 부서는 동일한 원격 측정(telemetry) 데이터를 읽고, 공급업체 품질은 LIMS 조인을 기반으로 구축되며, 안전은 이벤트 스트림을 기반으로 구축됩니다. 새로운 프로젝트마다 병렬 플랫폼을 구축하는 대신, 첫 번째 프로젝트에서 이미 비용을 지불한 인프라를 활용하게 됩니다.

지금 시작해 보세요

코드 리포지토리를 클론하고 자체 워크스페이스에서 databricks bundle deploy를 실행해 보세요. 자체 공장 데이터를 사용하려면 프로듀서가 시뮬레이터 대신 사용자의 historian을 가리키도록 설정하면 됩니다. Zerobus, 메달리온 레이아웃, 에이전트 도구 및 human-in-the-loop 초안은 그대로 유지됩니다. 클론하기 전에 브라우저에서 prodline_copilot_film.html을 열어 2분 분량의 애니메이션 가이드를 확인해 보세요.

자체 라인 모니터링 어시스턴트 구축에 관심이 있으시거나 더 자세히 알고 싶으신가요? Databricks 담당자에게 문의해 주세요. Databricks 전문가가 OT, MES, ERP 및 LIMS를 하나의 거버넌스가 적용된 레이크하우스로 통합하는 범위를 정의하도록 도와드릴 수 있습니다.

용어 사전

이 게시물에 사용된 약어(알파벳순)입니다.

  • APS – Advanced Planning & Scheduling (선진 계획 및 일정 수립)
  • CDC – Change Data Capture (변경 데이터 캡처)
  • CIP – Clean-In-Place (생산 라인의 세척 주기)
  • CMMS – Computerized Maintenance Management System (컴퓨터화 유지보수 관리 시스템)
  • CPG – Consumer Packaged Goods (소비재)
  • ERP – Enterprise Resource Planning (전사적 자원 관리)
  • IQR – Interquartile Range (사분위수 범위)
  • LIMS – Laboratory Information Management System (실험실 정보 관리 시스템)
  • LLM – Large Language Model (대규모 언어 모델)
  • MES – Manufacturing Execution System (제조 실행 시스템)
  • MILP – Mixed-Integer Linear Programming (혼합 정수 선형 계획법)
  • OEE – Overall Equipment Effectiveness (설비 종합 효율)
  • OT – Operational Technology (IT/OT 중 공장 현장 시스템 측면)
  • PLC – Programmable Logic Controller (프로그래머블 로직 컨트롤러)
  • QMS – Quality Management System (품질 경영 시스템)
  • RCA – Root Cause Analysis (근본 원인 분석)
  • SCADA – Supervisory Control And Data Acquisition (감시 제어 및 데이터 취득)
  • SOP – Standard Operating Procedure (표준 작업 절차서)

관련 Databricks 블로그

(이 글은 AI의 도움을 받아 번역되었습니다. 원문이 궁금하시다면 여기를 클릭해 주세요)

최신 게시물을 이메일로 받아보세요

블로그를 구독하고 최신 게시물을 이메일로 받아보세요.