필터 1
서비스에 와드 박기: 서비스 상태 가시화 프로젝트, 핑크와드를 소개합니다.
카카오페이
데브옵스

서비스에 와드 박기: 서비스 상태 가시화 프로젝트, 핑크와드를 소개합니다.

카카오페이증권이 고객 관점의 장애 가시화와 대응 자동화를 위해 핑크와드를 구축했습니다. 장애 탐지부터 담당자 호출, 요약, 보고서 작성까지 통합해 대응 시간을 크게 줄였습니다.

#SRE#MCP
12900
서비스의 건강을 수치화 할 수 있을까? — SLI/SLO
무신사
백엔드

서비스의 건강을 수치화 할 수 있을까? — SLI/SLO

서비스의 건강을 수치로 보기 위해 SLI와 SLO를 정의하고 운영하는 방법을 소개했습니다. 29CM 사례를 통해 지표 설계, 모니터링, 지속 개선 체계를 설명했습니다.

#SRE#모니터링
9100
SRE 3.0 - AI가 바꾸는 장애 대응·신뢰성·운영 패러다임
인포그랩
데브옵스

SRE 3.0 - AI가 바꾸는 장애 대응·신뢰성·운영 패러다임

AI가 SRE의 역할을 장애 대응 중심에서 예측과 품질 관리 중심으로 바꾸고 있음을 설명했습니다. 메르카리와 AIOps 사례를 통해 AI 신뢰성과 인간 협업의 필요성을 정리했습니다.

#SRE#AIOps
1500
SRE 3.0 - AI가 바꾸는 장애 대응·신뢰성·운영 패러다임
인포그랩
데브옵스

SRE 3.0 - AI가 바꾸는 장애 대응·신뢰성·운영 패러다임

AI가 SRE를 장애 대응자에서 예측·자동화 중심의 운영 전략가로 바꾸고 있습니다. 메르카리 사례처럼 품질 검증과 안전장치를 갖춘 인간-AI 협업이 중요합니다.

#SRE#AIOps
8200
표준을 통한 마이크로 서비스의 Observability 구축기
사람인
데브옵스

표준을 통한 마이크로 서비스의 Observability 구축기

Kubernetes 기반 마이크로서비스의 가시성을 확보하기 위해 OpenTelemetry와 SigNoz를 활용한 Observability 구축 과정을 정리했습니다. Collector 파이프라인과 Auto-Instrumentation, 운영 효율 개선 포인트를 함께 소개했습니다.

#Kubernetes#OpenTelemetry
4500
AWS Summit Seoul 2025 발표 후기 - 소중한 우리의 시간을 위한 클라우드 스케일링 자동화
올리브영
데브옵스

AWS Summit Seoul 2025 발표 후기 - 소중한 우리의 시간을 위한 클라우드 스케일링 자동화

AWS Summit Seoul 2025에서 클라우드 스케일링 자동화와 비즈니스 중심 모니터링 사례를 공유했습니다. 급격한 트래픽에 대비해 분류 기준, 증설 대상, 자동화 흐름을 정리했습니다.

#AWS#cloud
7200
데브시스터즈 엔지니어링 데이 - Data 돌아보기
데브시스터즈
기타

데브시스터즈 엔지니어링 데이 - Data 돌아보기

데브시스터즈가 제2회 엔지니어링 데이 - Data를 열고 데이터 조직의 고민과 사례를 공유했습니다. 로그 파이프라인, 준실시간 처리, 게임 DW 공통화와 데이터 활용 경험을 소개했습니다.

#Data#파이프라인
9100
버그가 아니라 장애를 잡아라!! QA와 카오스 엔지니어링의 만남
올리브영
백엔드

버그가 아니라 장애를 잡아라!! QA와 카오스 엔지니어링의 만남

예측 가능한 장애를 사전에 검증하기 위해 카오스 엔지니어링을 도입한 사례를 소개했습니다. 특히 mitmproxy로 API 응답에 null을 주입하는 Application Level 테스트 방법을 다뤘습니다.

#QA#카오스 엔지니어링
9900
베스핀글로벌
데브옵스

[WhaTap] RDS Failover / Reboot 관제 1 – Describe RDS

WhaTap에서 RDS Failover/Reboot 관제를 위해 선행 스크립트로 RDS 목록을 자동 수집하는 방법을 소개했습니다. AWS CLI, 크론, 권한 분리 등 운영 시 주의사항도 함께 정리했습니다.

#AWS#RDS
1500
베스핀글로벌
데브옵스

AWS Cloud9 사용 가이드

AWS Cloud9를 개발 테스트용으로 생성하고 Private 네트워크와 SSM으로 접근하는 방법을 안내했습니다. 또한 디스크 리사이즈, 파일 전송, 내부 브라우저 확인 절차를 정리했습니다.

#AWS#Cloud9
700
베스핀글로벌
데브옵스

AWS RDS Upgrade 사례

AWS RDS 업그레이드 사례를 순단 시간 기준에 따라 Normal, Near Real Time, B/G Deploy로 나누어 정리했습니다. DMS 복제와 HAProxy, Blue/Green 배포로 점진적 전환과 롤백 방식을 소개했습니다.

#AWS#RDS
1300
베스핀글로벌
데브옵스

k3d(k3s distribution in docker)로 k8s 빠르게 구축하기

k3d로 k3s 기반의 Kubernetes 개발·테스트 환경을 빠르게 구축하는 방법을 소개했습니다.\nIngress와 CNI 조합, 설치 방식, 기본 테스트까지 함께 정리했습니다.

#Kubernetes#Docker
1100
Karpenter 트러블슈팅 — 비용과 안정성 두마리 토끼 잡기
당근마켓
데브옵스

Karpenter 트러블슈팅 — 비용과 안정성 두마리 토끼 잡기

Karpenter 도입 과정에서 마주한 스케줄링 정합성, AMI 운영, Node Churn 문제를 정리했습니다. 적절한 budget과 리소스 보정으로 비용을 줄이고 안정성을 개선했습니다.

#Kubernetes#Karpenter
14000
신뢰성 향상을 위한 SLI/SLO 도입 2편 - 플랫폼 적용 사례
라인
데브옵스

신뢰성 향상을 위한 SLI/SLO 도입 2편 - 플랫폼 적용 사례

OBS 플랫폼에 SLI/SLO를 도입해 공용 미디어 플랫폼의 신뢰성을 측정하고 운영에 활용한 사례를 공유했습니다. 로그 기반 메트릭 수집과 Recording Rules로 대시보드 성능을 개선하고 알람 체계를 구성했습니다.

#SRE#SLI
2800