목록 보기
장애 대응보다 중요한 장애 복구 설계 — RTO/RPO를 현실적으로 잡는 법
데브옵스

장애 대응보다 중요한 장애 복구 설계 — RTO/RPO를 현실적으로 잡는 법

교보DTS
교보DTS
2026년 9월 28일

두줄요약

장애 대응과 별개로 복구 설계를 사전에 준비해야 한다는 점을 RTO/RPO로 설명했습니다. 워크로드 티어링과 DR 전략 선택, 정기적인 복구 테스트의 필요성을 정리했습니다.

문제 상황

  • 장애 대응만으로는 데이터 복구와 리전 단위 복구를 보장하기 어려운 문제
  • 백업, DR 리전, 복구 절차 부재 시 서비스 복원 불가 위험

구조와 흐름

  • RTO는 복구까지 허용 가능한 최대 시간, RPO는 허용 가능한 최대 데이터 손실량
  • HA는 서비스 연속성, DR은 재해 이후 복구로 목적과 범위가 다름
  • Zone 장애와 Region 장애를 구분해 대응 범위를 설계해야 함

선택 이유

  • RTO/RPO가 낮을수록 비용과 복잡도가 커져 워크로드별 티어링이 필요
  • Backup & Restore, Pilot Light, Warm Standby, Multi-Site Active/Active 중 요구 수준에 맞는 전략 선택 필요

주의할 점

  • Active/Active가 RPO 0을 보장하지 않음
  • Replication은 Backup을 대체하지 못하며 논리적 손상까지 막지 못함
  • 문서상 목표 RTO와 실제 DR Drill 결과를 구분해야 함

적용해볼 점

  • 비즈니스 영향도와 종속성 그래프로 워크로드별 RTO/RPO 재정의
  • DNS TTL, IaC, quota, failback 절차까지 포함한 복구 설계
  • 정기적인 DR 훈련으로 목표 달성 가능성 검증

다음 읽기

#AWS 주제를 다룬 다른 회사 글

RTO vs RPO: 재해 복구를 위한 AWS DR 전략 가이드

재해 복구(DR)의 필요성과 RPO, RTO의 의미를 정리하고 AWS DR 전략 4단계를 소개했습니다. 서비스 중요도와 비용을 고려해 적절한 복구 전략을 선택해야 한다고 설명했습니다.

가비아
가비아
데브옵스

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...