ChatGPT보다 오래 사용하는 AI 서비스, 그 뒤의 백엔드 팀 이야기
두줄요약
제타 백엔드 팀의 비동기·다중 저장소·멀티 클러스터 기반 운영 구조를 소개했습니다. 실험 인프라와 자동화, 장애 재발 방지로 대규모 트래픽을 관리합니다.
구조와 흐름
- Kotlin·Spring Boot 기반 API 서버와 WebFlux 비동기 처리 구조
- DynamoDB·PostgreSQL·OpenSearch·Valkey를 데이터 특성별로 분리
- Kubernetes 기반 API·데이터 저장소·모델 서버와 Istio 멀티 클러스터 운영
성능/운영 포인트
- MAB·A/B 테스트·리더보드 실험을 위한 안정적 실험 인프라 구축
- 실험 간 간섭 방지와 신뢰 가능한 데이터 수집·분석 환경
- 모니터링·알람·자동화·캐싱 전략으로 소수 인원의 운영 범위 확장
문제 상황
- 초기 트래픽 급증 시 긴 트랜잭션으로 인한 DB shared buffer 경합과 8시간 이상 쿼리 처리 장애
해결 방법
- 최근 배포 기능 롤백과 지표 추적으로 코드 로직의 근본 원인 식별
- 코드 수정과 DB Vacuum을 통한 상태 정상화
- 재발 방지 구조 개선과 모니터링 강화
