

삼성계정 서비스, 대규모 트래픽 속 무 중단 클라우드 인프라 업그레이드의 비결
삼성계정은 대규모 트래픽 속에서도 무중단 EKS 업그레이드를 위해 멀티 클러스터와 DNS 기반 트래픽 전환을 적용했습니다. 한 달간 3개 리전, 6개 클러스터를 전환하며 연동 서비스 이슈 없이 업그레이드를 마쳤습니다.
새로운 기술 블로그가 추가되었어요


삼성계정은 대규모 트래픽 속에서도 무중단 EKS 업그레이드를 위해 멀티 클러스터와 DNS 기반 트래픽 전환을 적용했습니다. 한 달간 3개 리전, 6개 클러스터를 전환하며 연동 서비스 이슈 없이 업그레이드를 마쳤습니다.


ExternalDNS로 EKS Ingress 도메인을 Route53에 자동 등록·관리하는 구성을 설명했습니다. 교차 계정 IAM 설정과 Helm 옵션, Ingress annotation, 삭제 동작 및 주의점까지 정리했습니다.


Amazon EKS 커뮤니티 애드온으로 모니터링, DNS, 인증서 관리 도구를 간편하게 설치하는 방법을 소개했습니다.\nExternal-DNS의 Route53 연동과 cert-manager 기반 HTTPS 적용 예시를 다뤘습니다.


Amazon Q Developer로 애플리케이션 복원력을 높이는 방법을 소개했습니다. 단일 AZ 아키텍처를 다중 AZ, 오토스케일링, 캐싱, DR 전략으로 개선하는 사례를 정리했습니다.


멀티 EKS 운영의 복잡성을 줄이기 위해 Hub-and-Spoke 구조와 GitOps 자동화를 소개했습니다. Blue-Green 전환과 통합 관찰성으로 무중단 업그레이드와 안정적 운영을 지원합니다.

AWS Summit Seoul Community Session 발표 후기와 준비 과정을 공유한 글입니다. EKS 하이브리드 활용 사례와 CDC 기반 실시간 통합 아키텍처 경험, 발표 준비에서 얻은 교훈을 정리했습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.


Nexthink는 15분 폴링 기반 알림의 한계를 해결하기 위해 Amazon Managed Service for Apache Flink를 도입했습니다. 이벤트 시간 처리와 상태 관리로 VDI 실시간 알림을 확장 가능하게 구축했습니다.

카카오뱅크 컨테이너플랫폼팀의 AWS GameDay 2025 우승 경험을 공유했습니다. 실제 장애 대응과 팀워크, 메시지 큐 최적화 전략이 승부를 갈랐습니다.

멀티 클러스터와 하이브리드 클러스터로 고가용성 인프라를 설계한 경험을 공유했습니다. GSLB, NodeLocal DNSCache, 분산 Control Plane로 장애 대응과 운영 유연성을 높였습니다.


AWS GPU 스팟 인스턴스와 EKS로 GPU 모니터링 PoC를 구축하는 과정을 정리했습니다. NVIDIA GPU Operator, Prometheus, Grafana로 GPU 메트릭을 수집하고 시각화했습니다.


토스증권은 Nasdaq Smart Options 실시간 시세를 국내에 안정적으로 전송하기 위해 글로벌 인프라와 EKS 기반 소비 구조를 구축했습니다. 또한 Sliding Window Counter와 장애 대응 체계를 적용해 지연과 유실을 줄였습니다.


EKS 1.29 지원 종료와 DNS 전파 지연 문제를 해결하기 위해 업데이트 방식을 재검토했습니다. ALB 멀티 타겟 가중치 전환으로 EKS 1.32 이전을 검증했습니다.

EKS 1.32 업데이트를 위해 기존 방식들의 한계를 비교하고 Blue-Green Multi Target 전환 방식을 검토했습니다. DNS 캐시 영향 없이 트래픽을 넘기고 빠른 롤백도 가능한 구성을 검증했습니다.

Karpenter 도입 과정에서 마주한 스케줄링 정합성, AMI 운영, Node Churn 문제를 정리했습니다. 적절한 budget과 리소스 보정으로 비용을 줄이고 안정성을 개선했습니다.