

2025년 SRE 트렌드 4가지 \:\ SLO, Toil, 옵저버빌리티, 인시던트 관리 전략
2025년 SRE 트렌드로 SLO, Toil, 옵저버빌리티, 인시던트 관리가 정리됐습니다. 성능 목표 관리와 운영 자동화, 사후 검토 문화의 중요성이 강조됐습니다.


2025년 SRE 트렌드로 SLO, Toil, 옵저버빌리티, 인시던트 관리가 정리됐습니다. 성능 목표 관리와 운영 자동화, 사후 검토 문화의 중요성이 강조됐습니다.


2025년 SRE 트렌드로 SLO, Toil, 옵저버빌리티, 인시던트 관리 전략을 정리했습니다. 성능 목표와 자동화, 도구 선택, 사후 검토 문화의 중요성을 짚었습니다.

SRE 관점에서 SLI, SLO, SLA의 차이와 필요성을 설명하고 사용자 여정 기반으로 신뢰성을 정량화하는 방법을 소개했습니다. 또한 오류 예산을 활용해 안정성과 개발 속도를 함께 관리하는 운영 방향을 정리했습니다.

장애 대응의 목표를 서비스 정상화에 두고, 에스컬레이션과 기록, 종료 공유, 포스트모템까지의 절차를 체계화했습니다. FRT 기준 티어링과 역할 분담, 커뮤니케이션 중심 대응 원칙도 함께 제시했습니다.


Hyperconnect SRE팀이 Azar 핵심 컴포넌트를 대상으로 첫 장애 모의 훈련을 진행한 과정을 공유했습니다. 실제형 시나리오와 stage 환경 보강을 통해 완화 우선 대응과 팀 간 지표 공유의 중요성을 확인했습니다.
![[Tech 세미나] Docker를 활용한 효율적 개발 및 보안전략](https://devocean.sk.com/thumnail/2024/9/19/2b06702e695e891aade8dafd0c3cf84f4740804454434c39d7741d56725998b0.png)

Docker를 활용한 효율적 개발과 보안 전략을 소개하는 Tech 세미나입니다.\nInner Loop, 이미지 빌드 Best Practices, Docker Scout와 Build Cloud를 다룹니다.
쿠팡 파트너스
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.


그룹콜 서비스의 PeerConnection 폭증 문제를 Origin-Edge 구조와 Router로 완화한 미디어 서버 인프라를 소개했습니다. 또한 라이브 스트리밍 인프라와 통합해 수평 확장과 운영 효율을 높인 과정을 설명했습니다.

네이버 검색 SRE의 상위 레벨 모니터링 시스템 구축 사례를 소개했습니다. 통합 대시보드, 규칙 기반 이상 탐지, ChatOps로 장애 대응 효율을 높였습니다.

네이버 검색의 지진 대응 사례를 통해 비상 대응 시스템과 상위 레벨 모니터링의 필요성을 설명했습니다. 빠른 이상 탐지, 자동 비상 모드, 수동 대응 UI가 서비스 안정성의 핵심이라고 정리했습니다.

AWS EKS를 더 안정적이고 확장성 있게 운영하기 위해 Karpenter 파일럿을 진행한 내용을 공유했습니다. 온프레미스 중심 환경에서 EKS 운영 방식을 점검한 사례입니다.


XY 국가 일부 사용자에게 통신사 Z 환경에서만 STOMP timeout이 반복 발생했습니다.\n데이터 분석, mobile proxy 재현, SNI 핫픽스로 원인을 좁히고 오류를 해소했습니다.

kubectl로 파드를 만들 때 내부에서 어떤 요청과 상태 변화가 오가는지 감사 로그를 따라가며 설명했습니다. kube-apiserver, kube-scheduler, kubelet의 역할 분담과 audit log 활용 포인트를 정리했습니다.

ABC Platform 팀이 데마에칸을 위한 플랫폼 조직으로 자리잡기까지의 1년을 회고했습니다. 복잡한 프로세스를 줄이고 작은 성공과 자율성을 바탕으로 팀 운영 체계를 다듬었습니다.
무신사 테크가 2023년 엔지니어링 성과를 공유하는 밋업을 준비하고 운영한 과정을 정리했습니다. 다양한 기술 발표와 시상식, 높은 만족도를 통해 사내 기술 문화 확산의 의미를 전했습니다.