

장애 모의 훈련 그리고 배운 점
Hyperconnect SRE팀이 Azar 핵심 컴포넌트를 대상으로 첫 장애 모의 훈련을 진행한 과정을 공유했습니다. 실제형 시나리오와 stage 환경 보강을 통해 완화 우선 대응과 팀 간 지표 공유의 중요성을 확인했습니다.
새로운 기술 블로그가 추가되었어요


Hyperconnect SRE팀이 Azar 핵심 컴포넌트를 대상으로 첫 장애 모의 훈련을 진행한 과정을 공유했습니다. 실제형 시나리오와 stage 환경 보강을 통해 완화 우선 대응과 팀 간 지표 공유의 중요성을 확인했습니다.


아자르의 개인정보 삭제 정책 시스템을 이벤트 기반으로 설계한 사례를 소개했습니다. 예약부와 처리부를 분리하고 Kafka, Databricks로 무손실 처리와 백필을 지원했습니다.

Debezium MSK Connect 장애 대응을 위해 Heartbeat 모니터링과 Failover 복구 흐름을 구성했습니다. 신규 Connector 재생성, op 변환, AOP 공통화로 데이터 연속성과 안정성을 높였습니다.

MySQL 기반 message-relay의 쿼리 지연과 lock wait 문제를 분석하고 개선한 사례를 소개했습니다. NOWAIT와 LIMIT 조합으로 lock 경합을 줄여 성능을 안정화했습니다.
![공통 Kafka 전환기 [Part 1. 공통 Kafka 전환 배경 및 전략]](https://miro.medium.com/v2/resize:fit:1200/1*Zgg56jduWlHfsjk4HhqKHQ.png)

도메인별로 분산 운영하던 Kafka Cluster를 공통 Cluster로 통합한 배경과 전략을 정리했습니다. KRaft, SASL/SCRAM, AKHQ, Grafana를 활용한 표준 운영 방향도 소개했습니다.
Iceberg를 DataLake에 도입해 Kafka·CDC 입수와 테이블 운영을 더 효율적으로 개선했습니다. 또한 자동화된 모니터링과 유지보수로 실시간 조회와 성능 최적화를 함께 달성했습니다.


SaaS TMS의 유연성과 성능 한계를 해결하기 위해 신규 배송 시스템을 구축했습니다. Kafka 기반 병행 운영과 단계적 확장으로 무중단 전환을 완료했습니다.


새로운 배송 시스템을 점진 전환과 롤백 가능 구조로 설계해 안정적으로 교체했습니다. 현장 협업과 반복 검증을 통해 배송 불가와 장애 없이 전환을 완료했습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.
재고 서비스를 수작업 중심 구조에서 ERP·Redis·Kafka 기반으로 개편한 사례를 다뤘습니다. 마이크로서비스화와 비동기 동기화로 성능과 안정성을 높인 과정과 성과를 소개했습니다.

Hive 배치 기반 파생 데이터 생성 지연 문제를 Spark Streaming으로 실시간 처리하도록 전환한 사례를 소개했습니다. Kafka 오프셋과 처리량, LAG 모니터링으로 안정적인 운영 방법도 함께 설명했습니다.


카프카 커넥트의 개념과 동작 방식을 소개하고, JDBC와 HDFS 커넥터로 파이프라인을 구성하는 흐름을 설명했습니다. 3.5 버전의 오프셋 관리 기능은 다음 글에서 이어서 다룬다고 예고했습니다.


Kafka 메시지 중복과 유실을 Producer, Consumer, MSK 운영 구간별로 나누어 해결 방법을 정리했습니다. AWS MSK 환경에서 설정과 운영 포인트를 함께 점검할 수 있는 글입니다.


엔터프라이즈 확장에 맞춰 워크스페이스 기반 인가 체계를 재설계한 사례를 소개했습니다. RBAC와 중앙 집중형 인가 서비스, CDC 동기화로 복잡성과 운영 리스크를 줄였습니다.

ksqlDB Join으로 뉴스탭 로그와 유저 클러스터 정보를 실시간 결합해 추천용 데이터를 만들었습니다. 외부 DB 조회를 줄이고 파티션과 조인 키를 맞춰 정확한 실시간 처리를 보장했습니다.