[클로바 시선 #59] 최신 GPU의 잠재력을 깨우다: B200을 위한 Mamba-2 커널 최적화
NVIDIA B200의 성능을 충분히 활용하려면 GPU 세대에 맞춘 커널 최적화가 필요합니다. FlashAttention의 세대별 발전 사례를 통해 이를 조명합니다.
새로운 기술 블로그가 추가되었어요
NVIDIA B200의 성능을 충분히 활용하려면 GPU 세대에 맞춘 커널 최적화가 필요합니다. FlashAttention의 세대별 발전 사례를 통해 이를 조명합니다.
국내 보안 AI·국방 AX·사우디 디지털트윈·B200 커널 최적화 소식을 소개했습니다. 보안 현장 실증과 GPU 맞춤 최적화로 AI 활용성과 성능을 높였습니다.


무븐트는 AWS 이벤트 기반 파이프라인으로 댄스 영상을 구조화된 학습 데이터로 변환했습니다.\nGPU 추론과 API를 분리한 다중 계층 서빙으로 성능과 확장성을 개선했습니다.
![[데이터센터 입문콘텐츠] GPU를 사 왔습니다. 그런데 이건 어디에 두나요? AI GPU와 데이터센터](https://static.gabia.com/www/common/gnb/gabia_logo_1200.jpg)

고성능 AI GPU는 서버실이 아니라 전력과 냉각을 갖춘 데이터센터에서 안정적으로 운용해야 합니다. GPU 확보와 함께 전력밀도, 발열, 하중까지 고려한 인프라 준비가 필요합니다.

토스증권은 쿠버네티스에서 GPU를 단순히 인식하는 수준을 넘어 운영 가능한 GPU-native 클러스터로 발전시키는 과정을 공유했습니다. GPU Ready 판정, 시범운행 검증, MIG 기반 배치 최적화로 서비스 투입과 자원 효율을 높였습니다.
![[데이터센터 입문 시리즈] AI 질문이 닿는 곳 데이터센터](https://static.gabia.com/www/common/gnb/gabia_logo_1200.jpg)

AI 질문은 네트워크와 데이터센터를 거쳐 GPU 추론 후 응답으로 돌아오는 물리적 과정입니다. 질문 한 번의 전력은 작지만 누적되면 데이터센터의 전력과 냉각 과제를 크게 키웁니다.

검색·추천 스코어링 모델을 vLLM 기반 풀링 런타임과 IO Processor로 전환해 성능을 크게 높인 사례를 소개했습니다. 전후처리 통합과 배치 최적화로 처리량과 지연 시간을 개선했습니다.

AI-Ready Infrastructure를 물리 인프라, 데이터, 조직 준비도의 세 층위로 구분해 정리했습니다. 국내는 물리 인프라에 치우쳐 있어 GPU 운영 서비스화와 인력 전환이 차별화 포인트라고 제시했습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

AI 시대 데이터센터는 GPU 수용을 넘어 전력, 냉각, 네트워크, 운영까지 통합 설계가 핵심이라고 설명했습니다. kt cloud는 워크로드별 맞춤형 AIDC와 연결 인프라 비전을 소개했습니다.
![[교육환경 AX와 데스크톱 가상화 ⑤] 데스크톱 가상화로 줄이는 캠퍼스 IT 관리 부담](https://static.gabia.com/www/common/gnb/gabia_logo_1200.jpg)

캠퍼스 AX 확산으로 늘어난 관리 부담을 데스크톱 가상화로 줄이는 방안을 소개했습니다. 환경 표준화와 GPU 자동 관리를 통해 운영 효율과 보안을 함께 높였습니다.

NHN FactoryX 기술 백서의 AI 인프라·플랫폼 설계 근거를 소개했습니다. 수랭식 냉각, Kubernetes 기반 GPU 동적 할당, GPUaaS 격리 구조를 다뤘습니다.

AI 연구용 GPU가 부족하고 활용률도 낮아 효율적 운영이 필요했습니다. 데스크톱 가상화로 연구 규모에 맞게 나누고 자동 회수해 공정성을 높였습니다.

수천 개의 서비스를 위한 GPU 공유와 모델 서빙 최적화를 다룬 Automatic Sharding 도입 사례를 소개했습니다. Manual Sharding의 한계를 넘어 자동 반영과 안정적 배포 전략까지 함께 공유했습니다.
AI 전환 기업을 위한 NIPA AX 원스톱 바우처 추가 모집을 안내했습니다.\nAI 솔루션·클라우드·데이터를 조합해 과제당 약 13억 원을 지원합니다.