아키텍처
[구축사례] kt cloud PLATFORM Observability Alert 플랫폼 구축하기
두줄요약
kt cloud가 Observability Alert 플랫폼을 구축한 사례를 정리했습니다. 조직별 격리, 통합관제 연계, 이력 관리를 위한 설계와 운영 포인트를 다뤘습니다.
문제 상황
- KCP 클라우드 환경에서 Grafana 기반 관측 체계는 있었지만 조직별 Alert 격리, 통합관제 연동, 이력 관리가 어려운 상태
- Grafana Managed Alert 중심 구조는 대규모 운영에서 확장성 제약과 표준화된 API 부재가 문제
구조와 흐름
- LGTM 스택 위에 Alert 관리 계층을 두고 Grafana, Mimir, Loki, 통합관제 시스템 사이 중간 레이어로 동작하도록 설계
- 사용자가 Grafana에서 Alert를 관리하면 API 계층이 조직 정보, namespace, label, 이벤트 저장 구조를 일관되게 처리
선택 이유
- 조직별 분리는 클러스터 분리 대신 namespace prefix 주입 방식으로 구현해 인프라 비용과 운영 복잡도 절감
- 관제 연계를 위해 필수 label 체계를 표준화하고, Loki 저장 시에는 카디널리티를 낮게 유지
- Rule 조회는 PostgreSQL First 전략으로 가용성과 조회 성능을 확보
성능/운영 포인트
- Alert는 단순 알림이 아니라 운영 정책 시스템으로 다뤄야 하며 Silence, Notification Policy, 관제 매핑이 중요
- 메시지보다 label 설계가 이벤트 분류와 담당 조직 식별 품질에 더 큰 영향
- 외부 SaaS 없이도 오픈소스와 자체 서비스 조합으로 조직 격리와 통합관제 수준 운영 체계 구현 가능


