목록 보기
백패커의 Amazon EKS 운영 최적화 여정 2부: 운영 심화 및 장애 대응 사례
데브옵스

백패커의 Amazon EKS 운영 최적화 여정 2부: 운영 심화 및 장애 대응 사례

AWS
AWS
2025년 5월 8일

두줄요약

백패커의 Amazon EKS 운영 중 발생한 Spot 인스턴스 종료와 트래픽 급증 장애 사례를 정리했습니다. AZ Rebalance 조정, Custom Scheduler, nf_conntrack 튜닝과 모니터링 강화로 안정성을 높였습니다.

문제 상황

  • 백패커의 Amazon EKS 운영 중 Spot 인스턴스 리밸런스, AZ Rebalance, 트래픽 급증으로 인한 부분 장애와 전면 장애 발생
  • 블루/그린 배포와 스팟 종료가 겹치며 Pod 축출, SIGTERM, 503 에러, ingressGateway 병목이 발생

원인 분석

  • ASG AZ Rebalance로 노드가 과도하게 종료되며 남은 Pod에 트래픽 집중
  • Spot 인스턴스 동시 종료와 할당 지연, 낮은 Replica 수로 서비스 가용성 저하
  • istio Node의 nf_conntrack 테이블 초과와 네트워크 성능 한계가 전면 장애의 근본 원인

해결 방법

  • ASG의 AZ Rebalance 비활성화로 불필요한 노드 종료 방지
  • Custom Scheduler로 On-Demand에 최소 Pod를 고정 배치해 Spot 종료 위험 완화
  • nf_conntrack_max 상향, Mesh 직접 통신 설정, 고성능 인스턴스 적용, 모니터링 강화

다음 읽기

#Amazon EKS 주제를 이어서 읽기

백패커의 Amazon EKS 운영 최적화 여정 1부: 운영 핵심 요소 최적화

백패커의 Amazon EKS 운영 중 발생한 CoreDNS, MySQL, Istio 관련 이슈와 해결 과정을 정리했습니다. 운영 환경에 맞춘 튜닝으로 안정성과 장애 대응력을 높인 사례를 소개했습니다.

AWS
AWS
데브옵스

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...