[사례연구] 사내 개인용 개발환경 이미지 실험기 2부: 만들면서 마주친 것들과 풀어간 방법
OpenStack 샌드박스 이미지에서 발생한 IP 변경과 시크릿 노출 문제를 자동 복구와 GitOps, Vault·ESO 조합으로 정리했습니다. 수동 배포를 줄이고 운영 재현성과 보안을 함께 높인 사례를 소개했습니다.

OpenStack 샌드박스 이미지에서 발생한 IP 변경과 시크릿 노출 문제를 자동 복구와 GitOps, Vault·ESO 조합으로 정리했습니다. 수동 배포를 줄이고 운영 재현성과 보안을 함께 높인 사례를 소개했습니다.
Claude Skill로 Technical Writer의 용어 표준화 업무를 정책 기반 자동화로 전환한 사례를 다루었습니다. 반복 작업을 줄이고 문서 품질과 개발 일관성을 함께 높인 구조를 소개했습니다.
흩어진 클라우드 운영 데이터를 하나의 기준으로 모으기 위해 레이크하우스 기반 통합 플랫폼 Deck 구축 과정을 소개했습니다. Object Storage를 SSOT로 두고 레이어를 분리해 과금과 분석의 신뢰성을 높였습니다.
에이전틱 AI 확산에 따라 LLM 추론 최적화 기술과 추론 전용 칩의 중요성이 커졌습니다. 양자화, KV 캐시 압축, LPU·TPU 활용으로 비용과 지연 시간을 함께 줄이는 방향을 정리했습니다.
AI 코딩 어시스턴트와 Firebase로 웹앱을 만들고 kt cloud AI NEXUS로 배포한 사례를 다뤘습니다. 또한 향후 AI 기능 확장을 염두에 둔 플랫폼 선택 이유를 정리했습니다.
OVN ACL Flow Sampling을 활용해 VPC Flow Log 서비스를 개발한 사례를 다뤘습니다. 로컬 I/O 부담을 줄이고 OVSDB 캐시로 메타데이터를 결합해 고속 로깅 구조를 구현했습니다.
AI·클라우드 환경에서 운영 안정성에 대한 기업들의 실제 고민을 다룬 설문 리포트입니다. 웨비나 참석자 200명의 응답으로 DR 준비 수준과 운영 과제를 살펴봤습니다.
AI 데이터센터와 클라우드 운영 전략을 다룬 뉴스레터였습니다. 전력, 냉각, 네트워크, 플랫폼 고도화와 사례를 폭넓게 소개했습니다.
AI 시대 데이터센터는 GPU 수용을 넘어 전력, 냉각, 네트워크, 운영까지 통합 설계가 핵심이라고 설명했습니다. kt cloud는 워크로드별 맞춤형 AIDC와 연결 인프라 비전을 소개했습니다.
AI 데이터센터의 WUE 개선을 위해 전기산화 기반 하이브리드 수처리 전략을 소개했습니다. 보충수 절감, CoC 향상, 운영비 감소 측면의 현장 적용 사례도 함께 정리했습니다.
네오클라우드 GPUaaS와 고밀도 AIDC가 AI 인프라의 성능과 효율을 어떻게 뒷받침하는지 설명했습니다. MIG, RDMA, 액체 냉각 등 핵심 기술로 고전력 AI 워크로드를 수용하는 방식을 다뤘습니다.
OVN 전환으로 기존 미터링 방식이 막히자 IPFIX와 Goflow2로 새 과금 계측 체계를 구축했습니다. 로컬 캐시 매핑과 자원 격리로 정확도와 성능을 함께 확보했습니다.
공공 클라우드를 위한 kt cloud PLATFORM의 운영 구조와 주요 장점을 소개했습니다. 멀티 리전, 보안 체계, AI 인프라 확장성을 통해 안정성과 확장성을 함께 강조했습니다.
물리 서버 환경에서 Cluster API와 BYOH Provider로 In-place Upgrade를 구현하고 검증했습니다. Rolling Upgrade와 병행해 인프라 제약에 맞는 업그레이드 전략을 확보했습니다.
데이터센터 냉동기의 원리와 중앙 냉수식 냉방 구조를 정리했습니다. 냉각 효율을 높이기 위한 운용 포인트와 예방 정비 항목도 함께 다뤘습니다.
kt cloud가 OpenStack 내재화를 위해 Zuul.CI 기반 Gating System을 구축했습니다. Upstream Job을 참조·상속해 회귀 검증을 자동화하고 최신 기준을 유지했습니다.
RoCEv2 기반 AI GPU 클러스터 네트워크 설계 시 InfiniBand와의 차이, 무손실 이더넷 구현 요소를 정리했습니다. 또한 혼잡 제어와 버퍼 설계, PFC 스톰 대응 등 운영 고려사항을 설명했습니다.
공공·엔터프라이즈 환경의 운영 안정성 기준과 DR 전략을 웨비나 후기 형식으로 정리했습니다. Multi-AZ, Multi-Region, 자동 전환과 BIA 기반 차등 적용이 핵심이었습니다.
Ceph 기반 스토리지 내재화로 상용 스토리지 의존과 비용 부담을 줄이는 방향을 정리했습니다. 또한 CRUSH, Self-Healing, 테스트 자동화로 운영 안정성과 확장성을 확보하는 방안을 다뤘습니다.
AI 데이터센터에서 WUE가 왜 중요한지와 수자원 효율 관리 방향을 정리했습니다. 전력 효율뿐 아니라 물 사용까지 함께 통제하는 운영이 핵심임을 설명했습니다.