목록 보기
Spark 3편 – Optimize Partition
백엔드

Spark 3편 – Optimize Partition

베스핀글로벌
베스핀글로벌
2025년 3월 25일

두줄요약

Spark에서 파티션이 병렬성, 메모리, 파일 수에 미치는 영향을 설명했습니다.\n입력·출력·셔플 파티션 설정을 조정해 성능을 최적화하는 방법을 소개했습니다.

핵심 내용

  • Spark에서 파티션이 병렬 처리 단위이자 메모리 단위가 되는 구조
  • 입력 파티션, 출력 파티션, 셔플 파티션의 역할과 설정값 차이
  • repartition, coalesce, spark.sql.files.maxPartitionBytes, spark.sql.shuffle.partitions 활용 포인트

적용해볼 점

  • 데이터 크기와 core 수에 맞춘 파티션 수 조정
  • write 시 파일 수와 크기 최적화를 위한 repartition, coalesce 선택
  • join, groupBy 시 shuffle spill 최소화를 위한 shuffle partitions 점검

다음 읽기

#Spark 주제를 이어서 읽기

Spark 7편: Optimising Shuffle Partitions(coalescePartitions)

Spark 3.0의 AQE와 coalescePartitions로 셔플 파티션을 동적으로 최적화하는 내용을 소개했습니다. 셔플 파티션 크기에 따른 성능 저하 문제와 파티션 병합 방식도 설명했습니다.

베스핀글로벌
베스핀글로벌
백엔드

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...