

Amazon EKS와 NVIDIA FLARE로 구현하는 연합학습 (Federated Learning)
Amazon EKS와 NVIDIA FLARE로 연합학습을 구성하는 방법과 CSE 평가 흐름을 설명했습니다. 세 가지 데이터 시나리오를 통해 전역 모델의 수렴, 일반화, 운영상의 관찰 포인트를 보여주었습니다.
새로운 기술 블로그가 추가되었어요


Amazon EKS와 NVIDIA FLARE로 연합학습을 구성하는 방법과 CSE 평가 흐름을 설명했습니다. 세 가지 데이터 시나리오를 통해 전역 모델의 수렴, 일반화, 운영상의 관찰 포인트를 보여주었습니다.


UneeQ는 Amazon EKS와 EC2 스팟 인스턴스를 활용해 디지털 휴먼 렌더링 비용을 줄였습니다. 워크로드 인지형 Group Manager로 다중 리전 GPU 용량을 자동 조정해 가동 시간도 유지했습니다.

Amazon EKS의 GPU 한 장에서 Gemma 4 31B를 vLLM으로 서빙할 때의 처리량과 지연 SLO 최적화 결과를 정리했습니다. NVFP4, prefix caching, speculative decoding, priority 스케줄링의 효과와 서빙 풀 분리 기준을 제시했습니다.

Amazon EKS에서 vLLM으로 Gemma 4 31B 서빙의 콜드 스타트를 단계별로 최적화한 사례입니다. S3 직결 로더, 캐시 영속화, sleep mode로 시작 시간과 GPU 비용을 줄였습니다.


여러 품질 시스템에 흩어진 자료를 근거 데이터로 정리해 APQR 리포트 생성을 자동화했습니다. 조회·계산·해석을 분리하고 Agentic AI 워크플로우로 연결해 처리 시간을 크게 줄였습니다.


AWS CloudHSM 기반 서명 시스템을 네트워크·애플리케이션·HSM 내부의 3계층으로 보호하는 구조를 소개했습니다. Istio, Kyverno, mTLS, 키 속성 설정으로 허용된 경로에서만 서명되도록 설계했습니다.


Amazon CloudWatch의 네이티브 OpenTelemetry 지표 수집과 PromQL 지원을 소개했습니다. EKS, Grafana, 애플리케이션 지표를 하나의 파이프라인과 쿼리 언어로 통합하는 방법을 설명했습니다.


Amazon S3 Files 도입 전에 비용, 성능, 공존 문제를 실측과 문서로 점검하는 방법을 정리했습니다. 소형 파일 과금, 읽기 경계, Mountpoint 충돌을 먼저 확인해야 합니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

Amazon EKS에서 NVIDIA OSMO를 활용한 Physical AI 워크플로 운영 레퍼런스 아키텍처를 소개했습니다. GPU 스케줄링, 아티팩트 보존, 모니터링, 보안을 함께 다루는 방법을 설명했습니다.


EKS Auto Mode와 Bifrost, Langfuse를 조합해 자체 관리형 Agentic AI 플랫폼을 구축하는 방법을 소개했습니다. 멀티모델 라우팅과 2계층 관측성으로 운영 안정성과 비용 최적화를 함께 확보했습니다.


EKS와 Spot, RabbitMQ, KEDA, Karpenter를 결합해 대규모 데이터 전처리 파이프라인을 구축했습니다. 단일 큐 병목을 없애 비용을 크게 줄이고 처리 시간도 수 일에서 수 시간으로 단축했습니다.


웅진씽크빅 북큐레이터 업무를 돕는 AI 에이전트를 AI-DLC로 2일 만에 MVP까지 구축했습니다. Kiro Steering과 AWS 서비스를 활용해 상담 준비, 회의록 정리, 코칭 지원을 자동화했습니다.


Amazon EKS에 Friendli Container Add-on을 적용해 LLM 추론 성능과 비용 효율을 높이는 방법을 소개했습니다. 클러스터 준비부터 배포, 검증, 정리까지의 절차를 단계별로 안내했습니다.


EKS에서 Slinky로 Slurm을 배포하는 방법과 구성 요소를 소개했습니다. Kubernetes와 Slurm을 함께 써서 AI·HPC 워크로드를 효율적으로 운영하는 방안을 정리했습니다.