

서버리스에서 쿠버네티스로 - Airflow 운영 경험기
관리형 서비스의 Airflow를 Kubernetes로 전환하며 스케줄러 CPU 과부하, 워커 OOM, 로그 누락 문제를 해결한 운영 경험을 공유했습니다. 자원 제한과 노드 분리를 통해 안정성을 높이고 비용도 줄인 사례입니다.
새로운 기술 블로그가 추가되었어요


관리형 서비스의 Airflow를 Kubernetes로 전환하며 스케줄러 CPU 과부하, 워커 OOM, 로그 누락 문제를 해결한 운영 경험을 공유했습니다. 자원 제한과 노드 분리를 통해 안정성을 높이고 비용도 줄인 사례입니다.


광고팀 MySQL 장애의 원인을 추천 API와 광고 서버 간 직접 호출 구조에서 찾았습니다. Kafka 토픽 발행으로 비동기화해 MySQL 부하를 줄이는 방향을 다뤘습니다.

6개 도메인을 하나의 통합 모델로 옮기기 위해 Kafka, CDC, Kafka Streams 기반 마이그레이션 파이프라인을 구축했습니다. Strimzi Operator로 Kafka Connect를 관리하며 준실시간 데이터 통합과 재실행 가능성을 확보했습니다.


배민 검색 홈 추천에 실시간 행동 이력을 반영하는 추천 시스템을 소개했습니다. 3개 컴포넌트로 구성해 CTR과 주문전환율을 높였습니다.


주행 이벤트 파이프라인에서 데이터 순서 보장과 대량 IoT 트래픽 처리를 위해 구조를 두 차례 개선했습니다. Kafka, NoSQL, 멱등성 설계로 비동기 실시간 처리와 정합성을 높였습니다.


주행 이벤트의 순서 보장과 대량 IoT 데이터 처리를 위해 파이프라인을 두 차례 개선했습니다. Kafka·NoSQL 기반 비동기 구조와 차량별 순차 처리로 정합성과 확장성을 높였습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

실시간 광고 사용자 ID 매핑 시스템과 그 설계 과정을 다룬 발표 세션을 공개했습니다. gRPC, Spark Structured Streaming, Kafka를 활용한 마이크로서비스 구성과 그래프 기반 매핑 방식을 소개했습니다.


실시간 장바구니 추천 모델을 위한 서빙 아키텍처와 운영 체계를 소개했습니다. TorchServe, Kubernetes, ArgoCD, MLOps와 모니터링 적용 사례를 정리했습니다.
대규모 트래픽이 몰린 라이브 쇼핑 서비스에서 Redis, DB, Gateway 병목을 줄인 방법을 공유했습니다. 서버 증설보다 모니터링과 캐시, 비동기 처리, 요청 통합을 통한 성능 개선이 핵심이었습니다.

Kafka Streams로 로그인 성공·실패 이벤트를 실시간 분석해 이상 로그인 감지 시스템을 구축했습니다. 상태 저장소, windowing, 모니터링 설정으로 보안 대응성과 운영 안정성을 높였습니다.

로케이션 코어팀이 Go와 Fx 기반 공유 라이브러리로 공통 컴포넌트를 모듈화한 방식을 소개했습니다. 반복 작업을 줄이고 비즈니스 로직에 집중할 수 있었지만, 라이브러리 검증과 확장 대응은 계속 필요했습니다.

쿠버네티스 네이티브 워크플로와 LitmusChaos로 Flink 스트리밍 파이프라인의 카오스 테스트를 자동화한 사례를 소개했습니다. 네트워크 지연, 파드 삭제, 노드 실패를 검증하며 복구 전략과 운영 개선점을 정리했습니다.

당근에서 LLM을 어떻게 활용하는지 서비스 사례와 운영 방법을 소개했습니다. 또한 프로덕션 적용을 위한 파이프라인, 모델 선택, 프롬프트 엔지니어링 원칙을 정리했습니다.

Tekton과 PIPE를 활용해 대용량 스트리밍 파이프라인의 성능 테스트를 자동화한 사례를 소개했습니다. 동적 설정과 지표 수집을 결합해 반복 실험과 결과 공유를 빠르게 수행했습니다.