장애 대응보다 중요한 장애 복구 설계 — RTO/RPO를 현실적으로 잡는 법
두줄요약
장애 대응과 별개로 복구 설계를 사전에 준비해야 한다는 점을 RTO/RPO로 설명했습니다. 워크로드 티어링과 DR 전략 선택, 정기적인 복구 테스트의 필요성을 정리했습니다.
문제 상황
- 장애 대응만으로는 데이터 복구와 리전 단위 복구를 보장하기 어려운 문제
- 백업, DR 리전, 복구 절차 부재 시 서비스 복원 불가 위험
구조와 흐름
- RTO는 복구까지 허용 가능한 최대 시간, RPO는 허용 가능한 최대 데이터 손실량
- HA는 서비스 연속성, DR은 재해 이후 복구로 목적과 범위가 다름
- Zone 장애와 Region 장애를 구분해 대응 범위를 설계해야 함
선택 이유
- RTO/RPO가 낮을수록 비용과 복잡도가 커져 워크로드별 티어링이 필요
- Backup & Restore, Pilot Light, Warm Standby, Multi-Site Active/Active 중 요구 수준에 맞는 전략 선택 필요
주의할 점
- Active/Active가 RPO 0을 보장하지 않음
- Replication은 Backup을 대체하지 못하며 논리적 손상까지 막지 못함
- 문서상 목표 RTO와 실제 DR Drill 결과를 구분해야 함
적용해볼 점
- 비즈니스 영향도와 종속성 그래프로 워크로드별 RTO/RPO 재정의
- DNS TTL, IaC, quota, failback 절차까지 포함한 복구 설계
- 정기적인 DR 훈련으로 목표 달성 가능성 검증



