GS에너지의 SageMaker Unified Studio와 Bedrock AgentCore로 구축하는 엔터프라이즈 에이전트 데이터 플랫폼
GS에너지는 SMUS와 Bedrock AgentCore를 결합해 프로젝트 구독 기반 데이터·에이전트 플랫폼을 구축했습니다. JWT·IAM·MCP의 권한 경계를 분리해 사용자 권한 내 데이터 조회를 구현했습니다.

EKS 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.
20개 표시
GS에너지는 SMUS와 Bedrock AgentCore를 결합해 프로젝트 구독 기반 데이터·에이전트 플랫폼을 구축했습니다. JWT·IAM·MCP의 권한 경계를 분리해 사용자 권한 내 데이터 조회를 구현했습니다.

AWS Bedrock AgentCore Runtime과 Strands Agents로 LLM 기능을 통합한 AI 서버 구축 방식을 소개했습니다.\nEKS 프록시, 단일 이미지 다중 Runtime, 관측성·평가·배포 운영 결정을 설명합니다.

인프라 티켓 반복 업무를 신청·승인·배포 포털로 전환한 배럭 구축 사례를 소개했습니다. 기존 ArgoCD·Terraform 파이프라인을 재사용하며 안전한 셀프서비스를 구현했습니다.

Jev와 AWS DevOps Agent를 결합한 Slack DevOps 봇의 판단·조사 구조를 소개했습니다.\n규칙보다 팀 지식과 피드백을 활용해 품질을 높이고 관리형 에이전트 한계를 보완했습니다.

쿠버네티스와 AWS EKS를 활용해 LLM 추론 인프라를 안정적으로 운영하는 방법을 설명했습니다. 특히 KV 캐시를 고려한 라우팅과 prefill/decode 분리를 통해 성능과 비용을 함께 개선하는 흐름을 다뤘습니다.

AWS Network Firewall의 컨테이너 속성 기반 규칙으로 EKS와 ECS의 동적 IP 변동을 추적하는 방법을 다뤘습니다. 또한 내부 동작, 반영 지연, SNAT와 라우팅 전제조건, 로그 한계까지 실험으로 정리했습니다.

Amazon EKS가 컨트롤 플레인 일부 파라미터 5가지를 고객이 직접 조정할 수 있게 했습니다. 노드 밀집 배치, HPA 반응성, 이벤트 보존, NodePort 범위 조정에 활용할 수 있지만 PCP와 운영 제약을 함께 고려해야 합니다.
아임웹은 ALB 한도와 ECS Target Group 제한을 넘기 위해 VPC Lattice와 Kong을 조합해 서비스 네트워크를 재설계했습니다. 서비스 통합으로 Lattice 고정비를 82% 절감하고, 무중단 이관과 배포 유실 0건을 확인했습니다.

EC2에서 EKS로 옮긴 뒤 컨테이너 메모리가 주기적으로 급증하는 현상을 추적했습니다. 원인은 로그 gzip 압축과 페이지 캐시였습니다.
생성형 AI는 클라우드 엔지니어의 업무를 빠르게 만들지만, 요구사항 해석과 트레이드오프 판단은 여전히 중요합니다. AI가 제시한 아키텍처와 코드를 검증하는 기본기와 시스템 전체를 보는 시야가 더 중요해졌습니다.
카카오뱅크가 AWS GameDay 2026에서 2년 연속 우승한 과정을 공유했습니다. Amazon Q Developer와 Kiro CLI를 활용한 장애 대응 전략과 실전 시행착오를 정리했습니다.

EKS 비용 최적화를 위해 AWS Graviton 도입 방법을 정리했습니다. 멀티 아키텍처 이미지를 준비한 뒤 카나리로 점진 전환하는 흐름을 소개했습니다.
EKS 11개 클러스터를 서비스 중단 없이 v1.35로 통일한 업그레이드 사례입니다. AI 에이전트를 오퍼레이터로 써 8일 만에 PR 109건을 처리하고 안전하게 전환했습니다.

EKS 11개 클러스터를 단계적 절차와 안전판으로 8일 만에 v1.35로 통일했습니다. AI 에이전트와 사람의 승인 분리를 통해 서비스 중단 없이 업그레이드를 마쳤습니다.

13년간 누적된 운영 흔적을 분류해 stage 환경을 새로 구축했습니다. Packer와 CodeDeploy, AI 분석을 결합해 운영에 가까운 검증 구조를 만들었습니다.

세 플랫폼에 흩어진 배포 이력을 APM 트레이스 기반 신호로 통합했습니다.\n장애 스레드에 직전 배포를 자동 첨부해 대응 속도를 높였습니다.
Amazon EKS에서 NVIDIA OSMO를 활용한 Physical AI 워크플로 운영 레퍼런스 아키텍처를 소개했습니다. GPU 스케줄링, 아티팩트 보존, 모니터링, 보안을 함께 다루는 방법을 설명했습니다.
MSA 장애 대응의 복잡성을 줄이기 위해 RCA 에이전트 SentryOn을 도입한 과정을 소개했습니다. 도메인 지식, 데이터 정제, Skill 분리, 프롬프트 캐싱으로 정확도와 효율을 높였습니다.
HYBE는 AWS DevOps Agent와 Custom MCP 서버로 인시던트 조사와 Jira 생성을 자동화했습니다. 서비스 카탈로그와 Skill을 더해 분산된 도구와 이름 불일치 문제를 해결했습니다.

딜라이트룸은 EKS Auto Mode로 멀티 클러스터 운영 복잡도를 크게 줄였습니다. 또한 로그 수집과 진단 자동화를 더해 장애 대응력도 높였습니다.
