토스증권이 GPU-aware를 넘어 GPU-native 클러스터를 구축한 방법
토스증권은 쿠버네티스에서 GPU를 단순히 인식하는 수준을 넘어 운영 가능한 GPU-native 클러스터로 발전시키는 과정을 공유했습니다. GPU Ready 판정, 시범운행 검증, MIG 기반 배치 최적화로 서비스 투입과 자원 효율을 높였습니다.

container 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.
20개 표시
토스증권은 쿠버네티스에서 GPU를 단순히 인식하는 수준을 넘어 운영 가능한 GPU-native 클러스터로 발전시키는 과정을 공유했습니다. GPU Ready 판정, 시범운행 검증, MIG 기반 배치 최적화로 서비스 투입과 자원 효율을 높였습니다.

Amazon EKS가 컨트롤 플레인 일부 파라미터 5가지를 고객이 직접 조정할 수 있게 했습니다. 노드 밀집 배치, HPA 반응성, 이벤트 보존, NodePort 범위 조정에 활용할 수 있지만 PCP와 운영 제약을 함께 고려해야 합니다.
EC2에서 EKS로 옮긴 뒤 컨테이너 메모리가 주기적으로 급증하는 현상을 추적했습니다. 원인은 로그 gzip 압축과 페이지 캐시였습니다.
항공 프론트엔드 구축 과정에서 레이아웃 컨테이너 설계를 다룬 글입니다. 제공된 내용상 컨테이너를 둘로 나누지 않은 선택이 핵심입니다.
사용자와 AI가 만든 코드를 운영 서버에서 안전하게 실행하기 위해 별도 Kernel 계층을 설계했습니다. 기존 서비스와 실행 환경을 분리하고 인증정보와 세션 상태를 밖으로 빼는 방향을 정리했습니다.
네오클라우드 GPUaaS와 고밀도 AIDC가 AI 인프라의 성능과 효율을 어떻게 뒷받침하는지 설명했습니다. MIG, RDMA, 액체 냉각 등 핵심 기술로 고전력 AI 워크로드를 수용하는 방식을 다뤘습니다.
쿠버네티스 전환으로 커진 VictoriaMetrics 리소스 문제를 조회·저장·수집 세 레이어로 나눠 최적화했습니다. 쿼리 분할, 보관 기간 축소, 수집 대상 축소로 장비 증설 없이 안정화했습니다.
Kubernetes Gateway API의 Policy 객체로 트래픽 제어를 세밀하게 나누는 방법을 정리했습니다. Ingress Annotation 대신 표준 CRD와 attach 방식 차이를 이해하는 것이 핵심입니다.
Kubernetes v1.35 Timbernetes의 주요 기능과 변경점을 정리했습니다. AI 워크로드 지원과 운영 개선, 업그레이드 시 주의사항을 함께 다뤘습니다.
Kubernetes StatefulSet의 Immutable 제약을 우회해 PVC를 먼저 확장하고 Non-cascade로 컨트롤러만 교체하는 절차를 정리했습니다. 서비스 중단 없이 스토리지를 늘리는 실무 트러블슈팅 방법을 설명했습니다.
AI 시대의 경쟁력은 빠른 실행과 실무 적용에 있다고 정리했습니다. 컨테이너 자원 최적화, AI 인프라 투자, AI Agent 활용 사례를 함께 소개했습니다.
업스테이지와 래블업이 독자 AI 파운데이션 모델 1차수 평가 통과 과정을 공유했습니다. 대규모 GPU 인프라 운영과 학습 최적화, 자동 복구 체계가 핵심이었습니다.

토스페이먼츠가 경계보안부터 제로트러스트까지 보안 체계를 단계적으로 고도화한 과정을 공유했습니다. IDC와 AWS 하이브리드 환경에서 다층 방어와 지속 검증 체계를 구축했습니다.

LY Corporation의 프라이빗 클라우드 Flava가 향후 어떻게 진화할지 소개했습니다. 개발자 경험, 보안, 스토리지, AI 기반 운영 자동화를 중심으로 미래 방향을 제시했습니다.

클라우드 네이티브 환경에서 애플리케이션 이식성을 높이는 방법을 정리했습니다. 컨테이너, 설정 외부화, 배포 전략으로 재배포 중심의 복구와 무중단 운영을 설명했습니다.
Node.js 컨테이너 종료 지연을 PID 1, 시그널 전파, 이벤트 루프 관점에서 분석했습니다. dumb-init과 셧다운 훅, Kubernetes Grace Period의 역할 분담을 적용했습니다.

Amazon Linux 1 지원 종료로 EKS 노드그룹 전환이 필요해졌습니다. 운영 구조를 유지하려면 새 노드그룹 교체가 기본 전략이 되고, 필요 시 신규 클러스터도 고려해야 했습니다.
Kubernetes를 DevOps 면접과 실무에서 설명하는 8가지 핵심 질문과 답변으로 정리했습니다. 주요 개념과 운영 트러블슈팅 점검 루틴까지 함께 다뤘습니다.

Kubernetes를 제대로 이해하는 DevOps 엔지니어를 구분하는 면접·실무 질문 8가지를 정리했습니다. 장애 진단 루틴과 오토스케일링, 네트워킹까지 핵심 개념을 함께 설명했습니다.

ARC를 활용해 Kubernetes 위에 GPU 서비스 개발용 CI/CD 인프라를 확장 가능하게 구축하는 방법을 소개했습니다. 자동화된 GPU 테스트 파이프라인과 Scalable CI/CD 구현 방향을 공유했습니다.