AI Native Observability Platform

AZONE

AI-powered · Zero-blindspots · Observability · Networking · Engineering

오픈소스 기반으로 Metric·Log·Trace를 통합 수집하고, 내부 LLM으로 장애의 근본 원인까지 자동 분석하는 AI Native Observability 플랫폼입니다. 포인트 솔루션이 아닌, 데이터 수집부터 AI 기반 근본 원인 분석(RCA)까지 하나로 연결하는 통합 옵저버빌리티 — 사람이 모두 보던 분석을 AI Agent가 대신해 MTTR을 단축합니다.

소개 영상

제품 개요

통합 데이터 수집

Prometheus·OpenTelemetry 기반으로 Metric·Log·Trace를 한 곳에 수집

AI 근본 원인 분석(RCA)

내부 LLM이 이상 징후 감지부터 RCA 보고서 생성까지 자동 분석

테넌트 기반 격리

권한별 데이터 격리로 안전한 멀티테넌시 운영 환경 제공

Ontology 자동 매핑

서버 위치·연결 관계를 자동 매핑해 정확한 장애 판단

MSA·클라우드 전환으로 관측의 사각지대가 늘고 있습니다. 사일로화된 도구, 느린 수동 상관분석, 고정 임계치의 오탐·미탐, 숙련자 의존 운영 — 흩어진 도구로는 근본 원인에 닿지 못합니다. AZONE은 폭증하는 텔레메트리를 통합하고 AI가 분석을 대신합니다.

오픈소스 기반 수집 · 저장 · 분석 아키텍처

01

수집 (Collect)

Prometheus(Metric) · OpenTelemetry(Log·Trace) — 표준 기반 에이전트 수집, 벤더 종속 없음

02

저장 (Store) · LGTM

Loki·Grafana·Tempo·Mimir — Metric/Log/Trace 통합 저장, 단일 쿼리 레이어

03

장기 저장

MinIO Object Storage — S3 호환 장기 보관, 비용 효율적 보존

04

AI 분석 엔진

내부 GPU 서버의 vLLM 기반 LLM + ML 모델 결합 — 실시간 이상 감지와 근본 원인 분석

AZONE만의 차별화된 5가지 강점

통합 관점

포인트 솔루션과 달리 Metric·Log·Trace를 단일 엔진에서 분석

테넌트 기반 격리

공용 인프라와 달리 권한별 데이터 격리를 기본 제공

Ontology 자동 매핑

수동 구성과 달리 서버 위치·연결 관계를 자동 매핑

할루시네이션 제거

추측 기반 LLM과 달리 Ontology 연결관계 근거로 환각 억제

ML + LLM 하이브리드

단일 모델 방식과 달리 ML 빠른 탐지 + LLM 심층 분석 결합

주요 기능

사용자 정의 대시보드

드래그&드롭 위젯 구성 — 기존 Grafana 템플릿을 AZONE 대시보드로 자동 변환, 팀·서비스별 템플릿 재활용

지능형 이상 감지

모든 Metric에 월~일 요일별 베이스라인을 자동 학습 — 바운더리 이탈 실시간 감지, 요일·시간대 특성 반영으로 오탐 최소화

자연어 연관지표 검색

'메모리 관련 지표'처럼 자연어로 검색 — 지표 클릭 시 의미·증감 시나리오 설명 제공

Ontology 토폴로지

서비스 관계 자동 매핑 + 도메인 구조 직접 보강 — 연결 관계로 장애 전파 경로 추적

메트릭·트레이스·로그 드릴다운

Label별 분할 분석, 스팬 단위 호출·쿼리 추적, 로그→트레이스 바로 연결

프로파일 드릴다운

Pyroscope 기반 CPU·메모리 함수 단위 분석 — 장애 전·후 Compare Flame Graph

GPU 모니터링

OpenLit·DCGM Exporter로 사용률·메모리·온도·전력에 SM·Tensor Core·NVLink까지 표준 수집 — LLM 추론 지연과 GPU 부하 연계 진단

이상 감지 리포트 · 자동 RCA

이상 메트릭+에러 트레이스+에러 로그를 종합해 근본 원인 자동 도출 — Generate RCA Report로 보고서 즉시 생성, PDF·Markdown 공유

경쟁 구도 — 통합 + AI Native 포지셔닝

구분기존 모니터링 솔루션AZONE
관측 범위포인트 솔루션 중심의 부분 관측Metric·Log·Trace 통합 관점 분석
이상 감지고정 룰·임계치 기반 알림요일별 베이스라인 학습 + ML 이상 감지
원인 분석근본 원인 분석은 엔지니어의 몫이상 감지부터 RCA 보고서까지 자동화
AI 기반-내부 GPU·vLLM 온프레 LLM · Ontology 근거 기반 판단

활용 시나리오 (5 USE CASES)

01

실시간 장애 예측 → 자동 RCA

SSE 예측 알림 → 이상감지 리포트 → RCA 보고서(원인·전파 경로·권장 조치)까지 수 분 내 완료

02

AI 시맨틱 검색

'결제 지연 관련 리소스'처럼 자연어 질의 → 연관 리소스·로그 추천 → 초기 진단 시간 대폭 단축

03

토폴로지 영향도 분석

디지털 트윈 그래프에서 이상 노드 하이라이트 → 상·하류 의존관계 추적 → 대응 우선순위 결정

04

Deep Dive 근본 메트릭 특정

메트릭 분해·라벨별 쿼리로 베이스라인 대비 편차 확인 → 수치 근거 기반 원인 메트릭 확정

05

Continuous Profiling

인프라 지표는 정상인데 응답이 느릴 때 — 코드·함수 레벨 병목을 플레임그래프 비교로 진단

도입 경로는 둘로 나뉩니다 — LGTM·Prometheus·OTel 기반을 이미 갖춘 고객은 추가 인프라 없이 즉시 연동(빠른 PoC), 미보유 고객은 관측성 기반 구축부터 단계적 도입. 앞으로 Telemetry의 주 소비자는 사람이 아니라 AI Agent입니다 — AZONE은 표준(OpenTelemetry)과 Agent가 추론하기 좋은 저장소(Prometheus) 위에 설계되어, Dashboard 중심에서 Agent 중심 Observability로의 전환을 이끕니다.

제품 문의하기