
당근 데이터 디스커버리 구축기: DataHub와 DataWiki로 여는 데이터 탐색의 첫걸음
DataHub로 메타데이터의 수집과 신선도 관리를 먼저 정비했습니다. 이후 DataWiki와 SSOT를 더해 도메인 맥락까지 담는 데이터 탐색 환경을 구축했습니다.

DataHub로 메타데이터의 수집과 신선도 관리를 먼저 정비했습니다. 이후 DataWiki와 SSOT를 더해 도메인 맥락까지 담는 데이터 탐색 환경을 구축했습니다.


포스타입 PM이 요구사항을 구체화하고 데이터 기반으로 기능을 기획하는 방식과 사례를 소개했습니다. 또한 자율성과 협업이 큰 PM 파트 문화와 중요한 역량을 함께 전했습니다.

검색 색인 파이프라인의 생산성과 안정성을 높이기 위해 설정 기반 자동화, Offline Storage 활용, 배치 처리 구조를 도입했습니다. 이를 통해 대용량 이벤트와 풀색인 비용 문제를 줄이고 운영 효율을 개선했습니다.


분산된 데이터 플랫폼의 메타데이터를 통합 관리하는 DataHub의 개념과 주요 기능을 소개했습니다. 검색, 계보 추적, 거버넌스, 접근 제어 관점에서 활용 포인트를 정리했습니다.

LLM으로 중고 스마트폰 게시글에서 시세 산정용 정보를 추출하고 후처리하는 서비스를 구축했습니다. BigQuery, MySQL, 벡터 DB를 조합해 시세 조회와 유사 게시글 추천을 구현했습니다.


기존 로그 배치 파이프라인의 분류 비효율, 낮은 신선도, 스키마 관리 부재를 정리하고 개선 방향을 설명했습니다. MSK와 Kafka Consumer, Protobuf, Schema Registry를 활용한 준실시간 구조로 전환한 과정을 소개했습니다.
쿠팡 파트너스
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

ETL의 기원부터 현대의 ELT, 클라우드, AI 활용 흐름까지 정리했습니다. 현업 파이프라인을 AWS Glue로 재구성했을 때의 장점도 함께 설명했습니다.

WATCHA는 멀티 클라우드 데이터 마이그레이션을 Argo Workflows로 통합해 운영 복잡성을 줄였습니다. 또한 DynamoDB Incremental Export와 권한 페더레이션으로 비용과 보안을 함께 개선했습니다.


오타와 유의어로 생기는 결과 없는 검색을 Vertex AI Search로 개선한 사례였습니다. BigQuery 기반 데이터와 튜닝으로 검색 품질을 높이고 A/B 테스트에서도 긍정적 성과를 확인했습니다.


BigQuery에서 Gemini Pro를 활용해 리뷰 요약과 분류, 홍보 문구 생성을 자동화하는 방법을 소개했습니다. JSON 응답, 배치 처리, RAI 결과 확인으로 정합성과 효율을 높이는 팁도 함께 다뤘습니다.


관리형 서비스의 Airflow를 Kubernetes로 전환하며 스케줄러 CPU 과부하, 워커 OOM, 로그 누락 문제를 해결한 운영 경험을 공유했습니다. 자원 제한과 노드 분리를 통해 안정성을 높이고 비용도 줄인 사례입니다.


Google Cloud Next '24 현장 방문기를 통해 최신 클라우드 기술과 AI 에이전트, Axion 발표를 살펴보았습니다. 데이터 플랫폼 마이그레이션 실무 관점에서 세션과 사례를 통해 얻은 인사이트도 함께 정리했습니다.


실시간 장바구니 추천 모델을 위한 서빙 아키텍처와 운영 체계를 소개했습니다. TorchServe, Kubernetes, ArgoCD, MLOps와 모니터링 적용 사례를 정리했습니다.

리디가 추천 시스템 고도화를 위해 Feature Store를 도입한 배경과 구축 과정을 소개했습니다. 키워드 추천에서 빠른 실험과 성과 개선을 확인했습니다.