목록 보기
고성능 GPU 클러스터 도입기 #2: 이주하는 데이터
데브옵스

고성능 GPU 클러스터 도입기 #2: 이주하는 데이터

토스
토스
2024년 10월 14일

두줄요약

고성능 GPU 클러스터에서 발생하는 통신 비용과 병목 구간을 하드웨어 관점에서 정리했습니다. 스토리지, 서버 내 GPU, 서버 간 통신에 맞춰 NVMe SSD, NVLink, NVSwitch, InfiniBand 선택을 제안했습니다.

핵심 내용

  • 자체 LLM 학습·추론을 위한 고성능 GPU 클러스터에서 통신 비용이 성능 병목의 핵심 요소
  • 통신 경로를 CPU-GPU, 서버 내 GPU-GPU, 서버 간 GPU-GPU로 구분해 하드웨어 관점에서 최적화 포인트를 설명
  • NVMe SSD, NVLink, NVSwitch, InfiniBand를 각각 스토리지·서버 내부·서버 간 통신 병목 완화 수단으로 정리
  • 워크로드 모니터링을 바탕으로 병목 구간에 맞는 클러스터 구성을 권장

다음 읽기

#LLM 주제를 이어서 읽기

고성능 GPU 클러스터 도입기 #1: 요리하라고 해서 왔는데 프라이팬이 없어요

토스증권이 투자 분석용 LLM을 위해 자체 고성능 GPU 클러스터를 도입한 배경을 설명했습니다. 개인정보 보호, 비용 효율, 실시간성 제약과 GPU 운용상의 유의점을 함께 짚었습니다.

토스
토스
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...