
장애 Alert의 원인을 스스로 찾다: SRE Observer 개발기
Alert를 자동으로 묶고 근본 원인까지 분석하는 SRE Observer 개발 과정을 소개했습니다. 근거 기반 가드레일과 승인 경계로 과신을 막고 대응 자동화를 설계했습니다.

Alert를 자동으로 묶고 근본 원인까지 분석하는 SRE Observer 개발 과정을 소개했습니다. 근거 기반 가드레일과 승인 경계로 과신을 막고 대응 자동화를 설계했습니다.


삼성계정 서비스의 AIOps가 실제 운영에서 어떻게 활용되는지와 업무 변화, 자율성 확장 방향을 다뤘습니다. 장애 분석·변경 추적·리포트 자동화 사례와 함께 Level 3, 4 전환 준비를 설명했습니다.
무신사 Retail Platform QA팀의 회귀 테스트 자동화 여정을 다뤘습니다. Playwright, Slack 봇, AI 기반 TC 생성기로 테스트 시간을 크게 줄인 사례입니다.


사내 AI 활용 경험 공유와 조직 간 교류 부족을 해결하기 위해 전사 해커톤을 기획했습니다. 비개발 직군까지 참여하도록 형식과 운영을 바꾸며 공감과 교류를 중심에 뒀습니다.

AWS FinOps Agent로 비용 이상 조사 과정을 자동화하는 방법을 소개했습니다. 알림부터 근본 원인 분석, Slack·Jira 전달까지 연결해 운영 시간을 줄였습니다.

연차 날 슬랙 알림으로 NPE 이슈를 확인한 사례를 다뤘습니다. 단일 예외를 팀의 방어 체계로 확장한 개선 과정을 정리했습니다.
쿠팡 파트너스
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

보안 업무에 AI를 적용할 때 사람의 판단을 남기고 AI는 1차 정리와 근거 수집을 맡기는 SAGE 플랫폼 설계를 소개했습니다. 3개 진입점과 멀티 에이전트, RAG, MCP, 피드백 루프로 운영하는 방식도 정리했습니다.

AI를 활용해 온라인 서비스의 24시간 즉시 대응 체계를 구축한 사례를 소개했습니다. 기존 모니터링과 알림 환경을 바탕으로 상시 관제 필요성을 다뤘습니다.


운영 문의 채널의 지연과 반복 작업을 줄이기 위해 3-에이전트 아키텍처를 설계했습니다. Knowledge·Code·DB로 역할을 나눠 빠른 응답과 정확한 진단을 노렸습니다.


GA 매니저가 AI와 함께 사내 인사·회의실 정보를 모아 조회 시스템을 만들었습니다. 반복 문의를 줄이고 보안을 고려한 슬랙·캘린더 연동 방식도 정리했습니다.
왓챠는 ADP를 구축해 비개발 직군도 AI 앱을 직접 만들고 배포할 수 있는 환경을 마련했습니다. 데이터 접근, 보안, 배포 속도 문제를 해결해 사내 생산성을 높였습니다.

상품 모니터링 체계를 Slack 알림 중심에서 DLQ 재처리, Workflow 자동 분석, 정합성 자동화로 진화시켰습니다. 사람이 개입할 일을 줄이고 장애 판단과 대응 속도를 높인 사례를 공유했습니다.

Alert 생성과 전달, 대응 흐름을 IaC와 표준화된 Slack 메시지로 정리한 개선 과정을 소개했습니다. 반복 Alert 재사용, grouped Alert, AI 연동, 모니터링 자체 감시까지 운영 개선을 다뤘습니다.

프런트엔드 개발의 병목을 컨텍스트 통합 문제로 보고, AI를 프롬프트가 아닌 워크플로로 활용하는 방법을 설명했습니다. 계획-구현-검증-PR까지 닫힌 루프를 만들면 재작업을 줄이고 품질을 높일 수 있다고 정리했습니다.