
Amazon EKS와 NVIDIA FLARE로 구현하는 연합학습 (Federated Learning)
두줄요약
Amazon EKS와 NVIDIA FLARE로 연합학습을 구성하는 방법과 CSE 평가 흐름을 설명했습니다. 세 가지 데이터 시나리오를 통해 전역 모델의 수렴, 일반화, 운영상의 관찰 포인트를 보여주었습니다.
핵심 내용
- 연합학습의 기본 개념과 중앙집중식 분산훈련과의 차이
- Scatter and Gather 흐름, 교차 사이트 평가(CSE)의 필요성과 해석 방식
- Amazon EKS 위 NVIDIA FLARE 배포 구조와 동적 작업 Pod 운용
구조와 흐름
- 서버가 전역 모델을 배포하고 클라이언트가 로컬 데이터로 학습한 뒤 가중치만 반환하는 라운드 반복
- CSE에서 모델 수집, 교차 검증, 결과 집계로 사이트별 일반화 성능을 행렬로 확인
- FLARE 컨트롤러가 태스크를 오케스트레이션하고 클라이언트 실행 결과를 집계하는 작업 기반 패턴
성능/운영 포인트
- IID 분포에서는 전역 모델과 로컬 모델이 비슷한 성능으로 안정적으로 수렴
- 비대칭 데이터에서는 로컬 모델 편차가 크지만 전역 모델이 사각지대를 보완하며 성능 회복
- 저품질 참여자 존재 시 로컬 과적합과 임포스터 징후를 CSE로 식별 가능


