2부: 정책을 따르는 평가자, LLM-as-a-Judge
LLM-as-a-Judge를 설계해 설명 생성 품질을 자동 평가하는 방법을 소개했습니다. 체크리스트와 critique 구조화로 인간 평가와의 정합성을 높이고, 디버깅과 데이터 정제에도 활용했습니다.


LLM-as-a-Judge를 설계해 설명 생성 품질을 자동 평가하는 방법을 소개했습니다. 체크리스트와 critique 구조화로 인간 평가와의 정합성을 높이고, 디버깅과 데이터 정제에도 활용했습니다.

정답 데이터가 없는 설명 생성 문제에서 좋은 설명의 기준을 먼저 합의하고 정책으로 정리하는 과정을 소개했습니다. PM과 엔지니어가 pass/fail 평가와 critique를 반복하며 모델과 평가 기준을 함께 수렴시켰습니다.

온디바이스 얼굴 식별 파이프라인의 병목을 정량 분석해 최적화한 사례를 소개했습니다. 연산 흐름 조정과 병렬화로 응답 시간과 처리량을 크게 개선했습니다.

비즈니스 문제를 AI 문제로 바꾸는 완화 접근과 명시적 가정의 중요성을 설명했습니다. 아자르 추천 시스템 사례로 장기 매출을 대화 시간 예측 문제로 단계적으로 정렬하는 과정을 소개했습니다.

실제 서비스에 맞는 ML 타겟 메트릭과 학습·평가 설계를 소개했습니다. 랜덤 수집 데이터와 relative mean CR lift로 배포 효과를 오프라인에서 가늠했습니다.

추천 실험의 병목을 줄이기 위해 Policy와 Experiment를 분리하고 Python DSL과 Z3 검증을 도입했습니다. 그 결과 설정 작성과 리뷰 시간이 크게 줄고, 엔지니어 개입 없이 실험을 운영할 수 있게 했습니다.

1:1 비디오 채팅의 회귀 테스트를 두 개의 driver와 pytest hook, segment, 병렬 실행으로 자동화했습니다. 이를 통해 매칭 간섭을 줄이고 실행 시간을 크게 단축하며 QA 반복 업무를 줄였습니다.

Azar의 실시간 추천 시스템을 위해 Flink KeyedProcessFunction 기반 스트림 조인과 배포 전략을 구축한 사례를 소개했습니다. Savepoint, Blue-Green 배포, Redis 중복 제거로 무중단과 Exactly Once를 구현했습니다.

ScyllaDB에 Local NVMe와 EBS를 묶은 Super Disk 구성을 도입해 복구 시간을 크게 줄였습니다. 또한 Windmill으로 교체·복구 절차를 자동화해 운영 안정성과 효율을 높였습니다.

Flink 어플리케이션의 end-to-end latency 병목을 찾기 위해 operator 지표와 flame graph를 활용하는 방법을 소개했습니다. 처리 시간과 처리 외 시간을 분리해 관측하고, 병목 유형별로 다른 개선 방향을 제시했습니다.

이벤트 스트리밍 처리를 위해 Flink SQL을 도입한 사례와 선택 이유를 정리했습니다. 또한 Kubernetes 기반 HA 구성, GitOps 배포, 운영 중 트러블슈팅과 모니터링 포인트를 공유했습니다.

Spring @Transactional 의 롤백이 언제 마킹되는지 예외 타입과 프록시 동작을 기준으로 정리했습니다. Kotlin 과 REQUIRES_NEW 까지 포함해 실제 동작 차이와 주의점을 설명했습니다.

아자르는 1:1 비디오 채팅 매칭을 위해 CUPID 추천 모델을 설계하고 적용했습니다. 투 타워 구조와 세션 임베딩 분리로 레이턴시를 줄이고 추천 성능을 높였습니다.

Hyperconnect SRE팀이 Azar 핵심 컴포넌트를 대상으로 첫 장애 모의 훈련을 진행한 과정을 공유했습니다. 실제형 시나리오와 stage 환경 보강을 통해 완화 우선 대응과 팀 간 지표 공유의 중요성을 확인했습니다.

아자르의 개인정보 삭제 정책 시스템을 이벤트 기반으로 설계한 사례를 소개했습니다. 예약부와 처리부를 분리하고 Kafka, Databricks로 무손실 처리와 백필을 지원했습니다.

추천 시스템을 행렬 분해 관점에서 정리하고, 하이퍼커넥트 AI의 모델링 방향을 소개했습니다. 또한 SGD 기반 학습, 보조 정보 활용, GNN 도입 보류 이유를 함께 설명했습니다.

하이퍼커넥트 AI 조직이 제품 문제를 연구로 풀고 논문으로 확장한 과정을 소개했습니다.문헌 조사, 실험, 테크 스펙을 통해 성능과 운영성을 함께 검증했습니다.

그룹콜 서비스의 PeerConnection 폭증 문제를 Origin-Edge 구조와 Router로 완화한 미디어 서버 인프라를 소개했습니다. 또한 라이브 스트리밍 인프라와 통합해 수평 확장과 운영 효율을 높인 과정을 설명했습니다.

XY 국가 일부 사용자에게 통신사 Z 환경에서만 STOMP timeout이 반복 발생했습니다.\n데이터 분석, mobile proxy 재현, SNI 핫픽스로 원인을 좁히고 오류를 해소했습니다.

아자르가 추천 모델의 목표를 리텐션으로 두고 아하 모멘트 기반으로 1차 지표를 찾는 과정을 소개했습니다. 세그먼트 분석과 A/B 테스트를 통해 신규·기존 사용자 모두에서 유효한 지표를 검증했습니다.
