
[케클러 인터뷰 시리즈] #5 - AI가 클라우드를 운영하려면, 데이터부터 이해해야 합니다
Cloud Native 운영에서는 모니터링만으로 원인을 찾기 어려워 Observability와 데이터 연결이 중요합니다. kt cloud는 AI가 활용할 수 있는 운영 데이터와 접근 통제 구조를 함께 설계했습니다.
새로운 기술 블로그가 추가되었어요

Cloud Native 운영에서는 모니터링만으로 원인을 찾기 어려워 Observability와 데이터 연결이 중요합니다. kt cloud는 AI가 활용할 수 있는 운영 데이터와 접근 통제 구조를 함께 설계했습니다.


Claude Code로 만든 데이터 분석 에이전트를 Amazon Bedrock AgentCore로 프로덕션에 배포하는 과정을 설명했습니다. 로컬 구성은 유지하면서 Gateway, Runtime, Web Search로 관리형 전환하는 방법을 다뤘습니다.


사내 지식이 흩어진 문제를 MCP 게이트웨이로 통합하고, 검색 전 권한 통제와 감사 체계를 먼저 설계했습니다. 초기에는 온프렘으로 시작해 이후 AWS 관리형 서비스로 단계적으로 이전했습니다.


Amazon Bedrock AgentCore를 VPC 모드와 privateEndpoint로 구성해 사내 LLM, IdP, MCP 서버를 인터넷 노출 없이 연동하는 방법을 설명했습니다. 또한 Route53 Inbound Endpoint와 인증서 요건, 보안 그룹 설계까지 함께 다뤘습니다.


AWS AI-DLC를 System Maintenance 환경에 맞게 3계층 Override 구조로 커스터마이징한 사례를 소개했습니다. 반복 질문 제거, 추측 방지, 자동화로 운영 유지보수 효율을 높인 점이 핵심입니다.

Google for Developers의 8월 첫째 주 위클리 업데이트를 소개합니다. AI, Android, Google Play, Flutter 관련 최신 개발자 소식과 읽을거리들을 한 번에 확인할 수 있습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.


Amazon Bedrock AgentCore로 에이전트를 개발보다 조립에 가깝게 구성하는 엔터프라이즈 플랫폼을 소개했습니다. 자체 구현한 레지스트리·정책·관측을 관리형 서비스로 전환하는 방향도 함께 다뤘습니다.

iOS 디자인 시스템 업데이트를 에이전트 루프로 자동화한 사례를 소개했습니다. 구현부터 배포와 QA까지 이어지며 대기 시간을 크게 줄인 구조를 설명했습니다.
당근 실험플랫폼이 지표 UI화, 상호배제 그룹, Experiment MCP로 실험 운영 병목을 줄인 사례를 소개했습니다. 실험 설계와 반복 작업을 더 빠르고 편하게 만들기 위한 구조와 자동화 방향을 다뤘습니다.


세 에이전트 구현 과정에서 겪은 검색 오판, 코드 분석 루프, DB 접근 안전장치를 정리했습니다. 사람 vs AI 비교로 속도와 한계도 함께 검증했습니다.

Grafana에서 자연어로 장애 원인을 찾는 SRELens 개발 사례를 소개했습니다.\nLLM 에이전트를 운영 환경에 맞게 제어하기 위해 프롬프트 레이어 분리와 도구 호출 가드레일을 설계했습니다.
LLM이 내부 업무를 잘 답하려면 검색보다 신뢰할 수 있는 컨텍스트 관리가 필요했습니다. 문서, 코드, 메신저를 공통 단위로 정규화하고 관계와 최신성을 함께 검증하는 Topic 설계를 소개했습니다.

Claude Code를 개인 생산성을 넘어 조직 생산성으로 확장하는 Amazon Bedrock 학습 플랜을 소개했습니다. 10개 영상으로 개인, 팀, 엔터프라이즈 운영까지 이어지는 4단계 로드맵을 제시했습니다.


흩어진 도메인 지식으로 AI가 중복 구현하는 문제를 지식 그래프로 줄인 도입 사례를 소개했습니다. 원본 참조·수집 파이프라인·수동 시드를 결합해 구현 전 검증 루프를 만들었습니다.