목록 보기
AI 학습부터 GPU 운영까지 한 곳에서, GPU Live
데브옵스

AI 학습부터 GPU 운영까지 한 곳에서, GPU Live

NHN
NHN
2026년 10월 8일

두줄요약

GPU Live는 AI 학습 실행과 GPU 자원 운영을 단일 콘솔로 통합했습니다.\n동적 할당, 빈패킹, 갱 스케줄링으로 GPU 활용률과 운영 통제를 강화합니다.

문제 상황

  • GPU 정적 할당에 따른 유휴 자원과 팀 간 활용률 불균형
  • 분산 학습의 GPU 동시 확보 실패, 수동 실행·반납, 멀티테넌트 통제 요구

구조와 흐름

  • 컨테이너 이미지·GPU 자원·실행 방식을 묶은 워크로드 중심의 단일·분산, 인터랙티브·배치 실행
  • 생성부터 인프라 할당, 학습 실행, 결과 저장, 자원 반환까지의 워크로드 라이프사이클 자동화
  • 시스템·조직·프로젝트 3계층 격리와 역할 기반 권한, 모니터링·미터링·감사 로그 통합

선택 이유

  • Kubernetes Device Plugin·Topology Manager 기반 동적 GPU 할당
  • 사용 중인 노드 우선 배치로 빈 노드를 보존하는 빈패킹 정책
  • 분산 인스턴스 전체가 가용할 때만 시작하는 갱 스케줄링

성능/운영 포인트

  • GPU 사용률·유지 시간 기반 유휴 워크로드 자동 회수와 즉시 풀 반환
  • NVIDIA DCGM 기반 실시간 모니터링, 5분 주기 사용량 수집, 이메일·웹 알림
  • 수정 불가 감사 로그와 개인정보 자동 마스킹, 스토리지 기반 학습 데이터·체크포인트 보존

다음 읽기

#GPU 주제를 이어서 읽기

AI 인프라 설계의 기술적 레퍼런스, 를 소개합니다

NHN FactoryX 기술 백서의 AI 인프라·플랫폼 설계 근거를 소개했습니다. 수랭식 냉각, Kubernetes 기반 GPU 동적 할당, GPUaaS 격리 구조를 다뤘습니다.

NHN
NHN
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...