비트윈 데이터팀의 Spark Summit EU 2017 참가기
두줄요약
Spark Summit EU 2017에서 Spark의 딥러닝 파이프라인과 Structured Streaming 동향을 공유했습니다.\n스타트업 데이터팀의 대규모 데이터 운영 방식과 컨퍼런스 발표 경험을 소개했습니다.
핵심 내용
- Spark Summit EU 2017의 기술 세션과 스타트업 Spark 활용 사례 발표 경험 공유
- Developer Day의 심층 기술 세션과 Enterprise Day의 다양한 활용 사례 구성
구조와 흐름
- Spark 기반 데이터 전처리 후 별도 딥러닝 환경에서 학습·예측을 수행하던 분리형 흐름
- Spark 딥러닝 파이프라인을 통한 데이터 로드·처리·모델 학습의 통합 실행 지향
- Structured Streaming, DataFrame·DataSet API 중심의 Spark 발전 방향
적용해볼 점
- 사전 학습 모델과 마지막 레이어 제거 모델 활용을 고려한 이미지 딥러닝 파이프라인
- 하루 약 2TB·2,000만 명 이상 사용자 데이터 환경에서 Raw 데이터 보관과 단순한 도구 중심 운영
- 컨퍼런스 발표·토론을 통한 기술 동향과 현장 활용 경험 교류

