[구축사례] 흩어진 운영 데이터를 하나로, kt cloud 운영 데이터 통합 플랫폼 Deck 구축기
흩어진 클라우드 운영 데이터를 하나의 기준으로 모으기 위해 레이크하우스 기반 통합 플랫폼 Deck 구축 과정을 소개했습니다. Object Storage를 SSOT로 두고 레이어를 분리해 과금과 분석의 신뢰성을 높였습니다.
Kafka 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.
20개 표시
흩어진 클라우드 운영 데이터를 하나의 기준으로 모으기 위해 레이크하우스 기반 통합 플랫폼 Deck 구축 과정을 소개했습니다. Object Storage를 SSOT로 두고 레이어를 분리해 과금과 분석의 신뢰성을 높였습니다.
우아한형제들 기술블로그 글을 엮은 《요즘 우아한 백엔드 개발》 출간 소식입니다. 아키텍처, 트래픽, 데이터, AI 활용 사례를 현장 경험 중심으로 담았습니다.
Kafka 컨슈머의 실패 메시지를 Retry/DLT로 어떻게 다룰지 설계와 운영 관점에서 정리한 글입니다.\n운영 중 마주친 함정 3가지를 통해 재처리 경로와 실패 처리 전략을 살펴봅니다.
OVN ACL Flow Sampling을 활용해 VPC Flow Log 서비스를 개발한 사례를 다뤘습니다. 로컬 I/O 부담을 줄이고 OVSDB 캐시로 메타데이터를 결합해 고속 로깅 구조를 구현했습니다.
팀마다 각자 관리하던 실기기 환경을 사내 디바이스 팜 네뷸라로 통합한 과정을 소개했습니다. Appium 대신 자체 드라이버와 실시간 미러링 구조로 속도와 운영성을 높였습니다.

관계 원천과 인가 튜플을 Outbox·CDC·Kafka로 동기화해 잔존 권한 문제를 줄이는 구성을 다뤘습니다. 부분 실패, 캐시, 감사 이력까지 함께 고려한 운영 포인트도 정리했습니다.

Grafana Mimir에 Kafka 기반 ingest-storage architecture를 도입한 경험과 운영상의 함정을 정리했습니다. partition과 ingester ordinal의 1:1 결합, backlog replay, scale-in 절차가 핵심 포인트였습니다.
OVN 전환으로 기존 미터링 방식이 막히자 IPFIX와 Goflow2로 새 과금 계측 체계를 구축했습니다. 로컬 캐시 매핑과 자원 격리로 정확도와 성능을 함께 확보했습니다.
천만 MAU를 버티기 위한 커뮤니티 시스템의 구조와 선택을 소개했습니다. 웹앱과 서버앱, 모듈과 이벤트 분리로 확장성과 운영성을 함께 확보한 사례입니다.
Airbridge는 Kafka 이벤트 처리에서 마이크로 배치 병목을 줄이기 위해 Differential 구조를 도입했습니다. 순서 보장과 중복 방지를 유지하면서 처리 속도를 10배 이상 높였습니다.

전시 상품 API의 Redis 병목과 캐시 단일 의존 문제를 구조적으로 개선했습니다. Kafka CDC, 병렬 처리, 다단계 조회로 더 빠르고 무너지지 않는 서빙 구조를 만들었습니다.
산업용 IoT에서 MQTT의 Publish/Subscribe 구조와 QoS, Topic 기반 관리 방식을 소개했습니다.\n제한된 네트워크 환경에서도 확장성과 실시간성을 확보하는 활용 포인트를 정리했습니다.

옴니채널 재고 정합성과 확장성 문제를 해결하기 위해 인벤토리 데이터 파이프라인을 이벤트 기반으로 재설계했습니다. Spring Batch, Kafka Fan-Out, Push/Pull 분리로 리드타임과 부하를 줄였습니다.
의료 설문 플랫폼에서 설문 정의와 수집을 담당하는 서비스를 헥사고날 구조와 CQRS로 설계했습니다. Master/Snapshot, Kafka, Outbox 등을 적용해 정합성과 운영 안정성을 확보했습니다.
플랫폼팀이 코드 바깥의 환경 실체를 선언으로 만드는 방식을 설명했습니다. Kafka 토픽 선언과 검증, 추적 가능한 거버넌스 사례를 다뤘습니다.
Flava DBaaS의 쿠버네티스 기반 아키텍처와 운영 구조를 소개했습니다. 또한 마이그레이션 도구와 서버리스, AI 기반 확장 방향까지 설명했습니다.

MySQL 기반 광고 성과 집계의 확장성과 안정성 문제를 해결하기 위해 StarRocks를 도입했습니다.\n외부 원천, MV 설계, 아키텍처 전환으로 부하 분리와 복구 편의성을 확보했습니다.
Iceberg 운영에서 스냅샷 폭증과 Small File 문제를 어떻게 다뤘는지 정리했습니다. 작업 이력 관리와 메인터넌스 정책으로 비용과 성능을 개선한 사례입니다.
X
서버 플랫폼 팀이 조직 성장에 맞춰 플랫폼을 계속 재설계하는 이유를 소개했습니다. AI 시대의 분석·개발·운영 변화와 그에 따른 가드레일까지 함께 다뤘습니다.