
서비스 장애를 예방하는 방법: Chaos Engineering
Chaos Engineering으로 서비스의 잠재적 SPOF를 검증하고 장애를 예방하는 방법을 소개했습니다. Toxiproxy를 활용한 테스트 환경 구성과 개선 대상 도출 과정을 공유했습니다.
새로운 기술 블로그가 추가되었어요

Chaos Engineering으로 서비스의 잠재적 SPOF를 검증하고 장애를 예방하는 방법을 소개했습니다. Toxiproxy를 활용한 테스트 환경 구성과 개선 대상 도출 과정을 공유했습니다.


App 테스트 자동화의 흔들리는 신뢰성을 정량 지표로 관리하며 개선했습니다. PostgreSQL과 Grafana로 Fail률과 수행시간을 추적해 근본 원인을 찾아 해결했습니다.

테이블센터의 검색과 탐색 경험을 10개월간 지표 기반으로 개선한 사례를 소개했습니다. 검색 속도와 만족도를 크게 높이고, 빠른 UT로 기능 방향을 검증했습니다.


거대 클래스에 섞인 Kinesis·비즈니스 로직을 Spring Kafka 기반 계층 구조로 분리했습니다. 상태별 처리에는 선택자를 도입해 테스트성과 확장성을 높였습니다.

프론트엔드 개발에서 테스트 자동화가 왜 필요한지, 어떤 장점이 있는지 다뤘습니다. 토스가 테스트 코드를 쓰고 쓰지 않는 기준도 함께 소개했습니다.


외부 API를 호출하는 통합 테스트의 불편함을 해결하기 위해 WireMock 도입 과정을 소개했습니다.\nRead Timeout과 비정상 응답을 stub으로 재현하는 방법도 함께 설명했습니다.


헤이딜러 QA팀의 주간 배포 환경에서의 업무 프로세스를 단계별로 소개했습니다. 탐색적 테스트와 자동화, 점진 배포, 회고를 통해 품질과 속도를 함께 관리했습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

개인정보 암호화 시스템 D-KMS에서 안정성과 빠른 릴리즈를 함께 맞추기 위한 CI/CD 전략을 공유했습니다. 테스트와 DORA Metrics로 릴리즈 품질과 성과를 측정한 내용입니다.

무신사 QA팀의 웹 테스트 자동화 운영 방식과 도구 구성을 소개했습니다. 릴리스 전후 회귀 테스트를 통해 품질과 안정성을 높인 사례입니다.

LINE 앱의 잡음 제거 성능을 정량적으로 측정하는 방법을 소개했습니다. 48kHz 음성 데이터와 다양한 잡음 조건을 3QUEST의 S-MOS, N-MOS로 평가했습니다.

키워드 알림의 오픈율 저하와 불필요한 알림 문제를 개선한 사례를 소개했습니다. 별도 모듈화, 공통 데이터 추상화, 섹션 확장 설계로 빠른 실험과 검증을 가능하게 했습니다.

기존 Fixture 생성 방식의 한계와 문제점을 정리하고, FixtureMonkey로 이를 개선하는 방법을 소개했습니다. 다양한 객체 생성 방식을 FailoverIntrospector로 묶어 재사용성과 테스트 편의성을 높이는 내용입니다.

대용량 스트리밍 파이프라인의 성능과 장애 대응을 실제 데이터로 검증해야 하는 배경을 설명했습니다. 쿠버네티스 네이티브 워크플로를 이용한 반복 실험 자동화 방식을 Tekton과 Litmus로 풀어갈 계획입니다.

입사 2개월차 백엔드 인턴이 프로젝트 개발과 장애 대응을 통해 배운 점을 공유했습니다. 테크 스펙, 테스트, 모니터링, 회고가 성장과 안정성에 중요했다고 정리했습니다.