
Amazon SageMaker AI와 AWS IoT Greengrass를 활용한 Physical AI 학습 파이프라인 구축하기
두줄요약
AWS에서 VLA·강화학습용 Physical AI 학습, 시뮬레이션 검증, 엣지 배포 파이프라인을 구성했습니다.\n학습 특성에 따라 SageMaker Pipelines·HyperPod를 선택하고 Greengrass로 모델을 배포합니다.
구조와 흐름
- VLA fine-tuning과 RL 학습을 공통 S3·CDK·시뮬레이션 워크스테이션 위에서 연결한 Physical AI 파이프라인
- SageMaker Pipelines 기반 데이터 변환·학습·스모크 평가·조건 게이트·Model Registry 등록 흐름
- Isaac Lab 폐루프 평가 통과 모델의 IoT Greengrass 엣지 배포와 TensorRT 추론 최적화
선택 이유
- 단발성 VLA fine-tuning에는 작업 종료 후 인스턴스를 반납하는 SageMaker Training Job·Pipelines
- 수일~수주 반복 RL 실험에는 공유 스토리지와 노드 복원력을 제공하는 SageMaker HyperPod
- RTX 렌더링 요구가 있는 시뮬레이션은 L40S 기반 EC2 G6e, 학습 GPU와 분리
성능/운영 포인트
- Isaac Lab의 GPU 병렬 시뮬레이션과 domain randomization 기반 Sim-to-Real 격차 완화
- HyperPod의 컴퓨트 노드 0대 시작, FSx for Lustre와 S3 자동 동기화 기반 상시 비용 절감
- TensorRT 적용 시 GR00T N1.6 DiT action head 추론 지연의 L40S 126ms→60ms, Thor 156.3ms→124.4ms
주의할 점
- S3 Files 체크포인트 로드는 반복 접근과 대역폭 제약 시 로컬 복사 대비 지연 가능성
- HyperPod Slurm의 노드 수 수동 조절 필요성과 다중 팀 환경에서 EKS task governance 고려
- 엣지 배포 모델은 Closed-loop 성공률 기준과 최소 권한 IAM·IoT 정책 게이트 필요

