목록 보기
입수는 Datalake로! (feat. Iceberg)
백엔드

입수는 Datalake로! (feat. Iceberg)

토스
토스
2024년 10월 29일

두줄요약

Iceberg를 DataLake에 도입해 Kafka·CDC 입수와 테이블 운영을 더 효율적으로 개선했습니다. 또한 자동화된 모니터링과 유지보수로 실시간 조회와 성능 최적화를 함께 달성했습니다.

문제 상황

  • Kafka·CDC 기반 기존 파이프라인의 높은 운영 비용과 배치 지연
  • Kudu·Parquet 환경의 스키마 변경, 파티션 관리, 쿼리 성능 한계
  • 수동 파이프라인 운영으로 인한 모니터링·정리·복구 부담

해결 방법

  • DataLake에 Iceberg 포맷 도입으로 데이터와 메타데이터 분리 관리
  • Spark·Kafka Connect·Airflow 기반 자동 입수와 정기 유지보수 자동화
  • 스냅샷 정리, manifest 최적화, rewrite_data_files, remove_orphan_files 활용

성능/운영 포인트

  • 준실시간 조회·수정, 비용 절감, 스키마 에볼루션 단순화
  • 파티션 프루닝, write.distribution-mode 조정으로 읽기·쓰기 성능 개선
  • 메타데이터 지표 모니터링과 Slack 알림으로 장애 대응 속도 향상

다음 읽기

#Airflow 주제를 다룬 다른 회사 글

Apache Iceberg 테이블 운영 실전기: 스냅샷 관리부터 Compaction까지

Iceberg 운영에서 스냅샷 폭증과 Small File 문제를 어떻게 다뤘는지 정리했습니다. 작업 이력 관리와 메인터넌스 정책으로 비용과 성능을 개선한 사례입니다.

밸런스히어로
밸런스히어로
백엔드

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...