

Flink SQL 도입기
이벤트 스트리밍 처리를 위해 Flink SQL을 도입한 사례와 선택 이유를 정리했습니다. 또한 Kubernetes 기반 HA 구성, GitOps 배포, 운영 중 트러블슈팅과 모니터링 포인트를 공유했습니다.
새로운 기술 블로그가 추가되었어요


이벤트 스트리밍 처리를 위해 Flink SQL을 도입한 사례와 선택 이유를 정리했습니다. 또한 Kubernetes 기반 HA 구성, GitOps 배포, 운영 중 트러블슈팅과 모니터링 포인트를 공유했습니다.


Redis 키스페이스 이벤트로 SIP 등록 갱신 타이머를 영속화해 서버 재시작에도 등록 누락을 줄였습니다. 대규모 환경에서는 보조 키, Goalkeeper, Redis 클러스터 확장과 hz 튜닝으로 안정성을 높였습니다.


OMS의 연동 데이터와 운영자 업무를 분석해 주문 이행·분배 계획 시스템이라는 비전을 정의했습니다.\nTAM 기능 통합과 CAPA 기반 자동화로 분산된 수기 주문 관리 업무를 개선했습니다.


OMS의 목적과 역할을 재정의하며 TAM 통합과 주문 분배 계획 단일화를 이끈 구축기입니다. 수기 업무를 줄이고 CAPA 기반 자동화로 운영 생산성을 높이는 과정을 다뤘습니다.
토스증권이 Kafka Active-Active 환경에서 consumer offset sync를 구현한 방식을 소개했습니다. Timestamp 검색과 Header 참조를 나눠 쓰며 유실을 막고, 작업 상황의 중복까지 줄이도록 운영했습니다.


비동기 메시지 규약이 제각각이라 추적과 유지보수가 어려운 문제를 길드 활동으로 해결했습니다. AsyncAPI와 Code-Gen 도구 WAAX를 도입해 문서화, 정적 검증, 가시화를 함께 개선했습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

Spring Cloud Stream으로 데이터 추출과 조합 파이프라인을 구성한 사례를 소개했습니다. 멀티 모듈과 Function 규격화를 통해 확장성과 결합도 개선 방향도 제시했습니다.

토스증권의 Active-Active Kafka 이중화에서 동일한 토픽명 미러링과 무한 루프 방지 방식을 소개했습니다. DLQ, 커스텀 메트릭, 클러스터 분리로 정합성과 운영성을 높인 사례입니다.


MSA 기반 미디어 업로드 구조를 재설계해 람다 간 복잡한 호출과 분기 코드를 줄였습니다. 또한 DynamoDB, DocumentDB, Step Functions, Kafka를 활용해 유지보수성을 높였습니다.


카프카 컨슈머 처리량을 외부 DB 부하에 맞춰 동적으로 조절하는 방법을 다뤘습니다. Thread.sleep()의 한계와 pause()/resume()을 활용한 리밸런싱 회피 방식을 설명했습니다.
토스증권의 Kafka 데이터센터 이중화 개요를 소개하며 Active-Active와 Stretched Cluster를 비교했습니다. 가용성과 성능을 고려해 Active-Active를 선택하고 DNS와 Offset Sync 전략을 설명했습니다.


로그 레벨을 ERROR와 WARN으로 재정의하고, 상황별 임계치 기반 알람을 구성했습니다.\n알람 피로를 줄이면서 운영 문제를 빠르게 인지하도록 로그를 지속 관리했습니다.


운영 로그의 기준을 다시 정리해 실제 장애와 가짜 에러를 구분하는 방법을 다뤘습니다. 알람 노이즈를 줄이고 빠른 인지를 위해 로그 레벨과 임계치를 팀 기준으로 조정했습니다.


프리즘의 메시지 브로커를 SQS, Kafka, RabbitMQ 순으로 바꾼 이유를 정리했습니다. 요구 사항에 맞는 전달 보장과 스케일링, 분배 특성이 선택의 핵심이었습니다.