목록 보기
VCNC가 Hadoop대신 Spark를 선택한 이유
백엔드

VCNC가 Hadoop대신 Spark를 선택한 이유

타다
타다
2015년 5월 18일

두줄요약

MapReduce 중심 분석 시스템을 Spark·Zeppelin·AWS 기반으로 점진 전환했습니다. 분석 시간을 약 8시간에서 1시간으로 줄이고 관리 부담과 대시보드 운영 복잡도를 낮췄습니다.

문제 상황

  • 사무실 내 자체 장비 관리, 로그 별도 저장, MapReduce 분석, 대시보드 개별 운영으로 인한 높은 관리 부담
  • 제한된 머신 수와 복잡한 분석·시각화 과정으로 긴 분석 시간과 낮은 즉석 분석 대응성

선택 이유

  • MapReduce의 복잡한 Java 코드와 Hive 쿼리 최적화·성능 한계
  • 메모리 기반 처리, Scala 기반 간결한 코드, interactive shell을 제공하는 Apache Spark
  • 코드 실행 결과의 기록·재실행·시각화를 지원하는 Apache Zeppelin

구조와 흐름

  • AWS 기반 Zeppelin 서버와 Spark 서버 운영, 메모리 중심 EC2 R3 인스턴스 활용
  • 서비스 서버가 S3에 업로드한 로그를 직접 분석하고 중간 결과도 S3 파일로 저장
  • Zeppelin scheduler 기반 일일 배치와 report mode 기반 대시보드 공유

성능/운영 포인트

  • 일일 배치 분석 시간 약 8시간에서 약 1시간으로 단축
  • interactive shell 기반 원인 탐색·수정 및 즉석 분석 지원
  • 시스템 단순화로 관리 포인트와 대시보드 운영 부담 축소, 신규 오픈소스의 세부 기능·안정성 과제

다음 읽기

같은 회사의 연관 글

비트윈이 사용자를 분석하는 방법

비트윈은 Access Log를 기반으로 사용자 행동을 집계하고 분석 플랫폼을 단계적으로 확장했습니다. 익명화와 시각화를 바탕으로 개인정보를 보호하며 의사결정과 실행으로 연결했습니다.

타다
타다
백엔드

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...