VCNC가 Hadoop대신 Spark를 선택한 이유
두줄요약
MapReduce 중심 분석 시스템을 Spark·Zeppelin·AWS 기반으로 점진 전환했습니다. 분석 시간을 약 8시간에서 1시간으로 줄이고 관리 부담과 대시보드 운영 복잡도를 낮췄습니다.
문제 상황
- 사무실 내 자체 장비 관리, 로그 별도 저장, MapReduce 분석, 대시보드 개별 운영으로 인한 높은 관리 부담
- 제한된 머신 수와 복잡한 분석·시각화 과정으로 긴 분석 시간과 낮은 즉석 분석 대응성
선택 이유
- MapReduce의 복잡한 Java 코드와 Hive 쿼리 최적화·성능 한계
- 메모리 기반 처리, Scala 기반 간결한 코드, interactive shell을 제공하는 Apache Spark
- 코드 실행 결과의 기록·재실행·시각화를 지원하는 Apache Zeppelin
구조와 흐름
- AWS 기반 Zeppelin 서버와 Spark 서버 운영, 메모리 중심 EC2 R3 인스턴스 활용
- 서비스 서버가 S3에 업로드한 로그를 직접 분석하고 중간 결과도 S3 파일로 저장
- Zeppelin scheduler 기반 일일 배치와 report mode 기반 대시보드 공유
성능/운영 포인트
- 일일 배치 분석 시간 약 8시간에서 약 1시간으로 단축
- interactive shell 기반 원인 탐색·수정 및 즉석 분석 지원
- 시스템 단순화로 관리 포인트와 대시보드 운영 부담 축소, 신규 오픈소스의 세부 기능·안정성 과제

