AI 학습부터 GPU 운영까지 한 곳에서, GPU Live
두줄요약
GPU Live는 AI 학습 실행과 GPU 자원 운영을 단일 콘솔로 통합했습니다.\n동적 할당, 빈패킹, 갱 스케줄링으로 GPU 활용률과 운영 통제를 강화합니다.
문제 상황
- GPU 정적 할당에 따른 유휴 자원과 팀 간 활용률 불균형
- 분산 학습의 GPU 동시 확보 실패, 수동 실행·반납, 멀티테넌트 통제 요구
구조와 흐름
- 컨테이너 이미지·GPU 자원·실행 방식을 묶은 워크로드 중심의 단일·분산, 인터랙티브·배치 실행
- 생성부터 인프라 할당, 학습 실행, 결과 저장, 자원 반환까지의 워크로드 라이프사이클 자동화
- 시스템·조직·프로젝트 3계층 격리와 역할 기반 권한, 모니터링·미터링·감사 로그 통합
선택 이유
- Kubernetes Device Plugin·Topology Manager 기반 동적 GPU 할당
- 사용 중인 노드 우선 배치로 빈 노드를 보존하는 빈패킹 정책
- 분산 인스턴스 전체가 가용할 때만 시작하는 갱 스케줄링
성능/운영 포인트
- GPU 사용률·유지 시간 기반 유휴 워크로드 자동 회수와 즉시 풀 반환
- NVIDIA DCGM 기반 실시간 모니터링, 5분 주기 사용량 수집, 이메일·웹 알림
- 수정 불가 감사 로그와 개인정보 자동 마스킹, 스토리지 기반 학습 데이터·체크포인트 보존



