목록 보기
Spark 8편: Rest API를 통한 데이터 수집
백엔드

Spark 8편: Rest API를 통한 데이터 수집

베스핀글로벌
베스핀글로벌
2025년 3월 28일

두줄요약

Spark에서 Rest API 데이터를 수집하는 두 가지 방법을 비교했습니다. 단순 requests 방식과 Spark UDF 방식의 장단점 및 대량 데이터 처리 시 고려점을 설명했습니다.

핵심 내용

  • Spark는 Rest API를 직접 수집하는 기능이 없어 외부 데이터를 다룰 때 별도 구현이 필요
  • 단순 requests 기반 수집은 쉽지만 Driver 단일 스레드로 동작해 대량 데이터에 취약
  • Spark UDF 활용 시 파티션 단위 병렬 처리가 가능해 대량 수집에 유리

장단점

  • Python requests 방식: 구현 단순, 초기 테스트에 적합, 확장성 부족
  • Spark UDF 방식: 병렬 처리 가능, 대량 데이터에 유리, 코드 복잡도 증가

적용해볼 점

  • 수집 데이터량과 성능 요구에 따라 방식 선택
  • 파티션 수와 병렬 처리 구조를 고려한 코딩 필요
  • Spark의 커넥터와 생태계 활용 방안 함께 검토

다음 읽기

#Spark 주제를 이어서 읽기

Spark 9편: JDBC 병렬처리 시 주의 사항

Spark JDBC 병렬처리의 기본 사용법과 파티션 분할 방식의 주의점을 설명했습니다. 소수점 버림으로 인한 skew를 줄이기 위해 upperBound 설정과 컬럼 분포 점검이 필요했습니다.

베스핀글로벌
베스핀글로벌
백엔드

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...