목록 보기
리멤버앤컴퍼니의 Amazon S3 Tables를 활용한 실시간 분석 워크로드 구축하기 2부: S3 Tables를 프로덕션 환경에서 운영하기
아키텍처

리멤버앤컴퍼니의 Amazon S3 Tables를 활용한 실시간 분석 워크로드 구축하기 2부: S3 Tables를 프로덕션 환경에서 운영하기

AWS
AWS
2025년 10월 29일

두줄요약

S3 Tables의 운영 전략과 StarRocks 도입 과정을 정리했습니다. Compaction, Snapshot, 모니터링, 캐시 TTL 설정의 실무 포인트를 다뤘습니다.

핵심 내용

  • Amazon S3 Tables의 프로덕션 운영 전략 정리
  • Compaction, Snapshot 관리, Unreferenced File 제거, 모니터링 체계 구성
  • 실시간 분석 엔진으로 StarRocks를 EKS 상 Shared-data 방식으로 도입

성능/운영 포인트

  • Small File 증가를 막기 위한 자동 Compaction과 targetFileSizeMB 512MB 운영
  • 테이블 용도별 Snapshot 보존 정책 차등 적용과 메타데이터 증가 관리
  • PyIceberg 기반 메타데이터 수집, 파일 수·크기·평균 크기 지표화

적용해볼 점

  • S3 Tables REST Endpoint와 PyIceberg로 파일 단위 관찰 가능
  • Iceberg 메타데이터 캐시 TTL은 CDC Commit 주기보다 짧게 설정 필요
  • 분석 엔진 선택 시 저지연, 비용, 운영 편의성 함께 검토

다음 읽기

#Amazon S3 Tables 주제를 이어서 읽기

리멤버앤컴퍼니의 Amazon S3 Tables를 활용한 실시간 분석 워크로드 구축하기 1부: S3 Tables에 CDC 데이터 레이크 구축하기

리멤버앤컴퍼니가 Aurora MySQL의 분석 부하를 줄이기 위해 S3 Tables 기반 CDC 데이터 레이크를 구축한 과정을 다뤘습니다. 기존 데이터 이관, Debezium·MSK·Iceberg Kafka Connect 설정과 운영상 주의점을 정리했습니다.

AWS
AWS
데브옵스

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...