
Hive는 잊으려 했지만, Spark는 기억하고 있었다: 사라진 get_table RPC 복원기
Hive 4.2에서 제거된 get_table RPC로 Spark 잡이 실패한 원인을 추적했습니다.\nThrift IDL 계약을 보존한 RPC 복원과 생성 코드 검증 방식을 정리했습니다.
새로운 기술 블로그가 추가되었어요

Hive 4.2에서 제거된 get_table RPC로 Spark 잡이 실패한 원인을 추적했습니다.\nThrift IDL 계약을 보존한 RPC 복원과 생성 코드 검증 방식을 정리했습니다.

Oozie/Sqoop 기반 데이터 파이프라인을 Airflow/Spark로 전환한 사례를 정리했습니다.\nYAML 템플릿, 동적 파티셔닝, Parquet 최적화로 운영성과 조회 성능을 함께 개선했습니다.

실제 운영 데이터로 Iceberg와 Hive를 비교해 비용과 속도 차이를 검증했습니다. 큰 테이블부터 옮기고 SQL 패턴을 바꿔야 효과가 커졌습니다.

Flink와 Apache Paimon으로 실시간 유효 광고 선정 파이프라인을 구축한 사례를 소개했습니다. 실시간 처리 보장, 조인, 타임 트래블, 자동 compaction 같은 Paimon 활용 포인트를 정리했습니다.

대용량 감사 로그를 HotStore와 ColdStore로 분리해 효율적으로 저장하고 조회하는 구조를 소개했습니다. S3, Athena, Bloom Filter를 활용해 비용과 연동 복잡도를 줄이는 방안을 설명했습니다.

Hive 배치 기반 파생 데이터 생성 지연 문제를 Spark Streaming으로 실시간 처리하도록 전환한 사례를 소개했습니다. Kafka 오프셋과 처리량, LAG 모니터링으로 안정적인 운영 방법도 함께 설명했습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.


Hive 사용량 통계를 수집해 하둡 플랫폼 운영 효율을 높인 개발 사례를 소개했습니다. 크롤링 한계를 로그 분석과 실시간 처리 구조로 개선하고 Iceberg 적재 방식도 조정했습니다.

비트윈은 Access Log를 기반으로 사용자 행동을 집계하고 분석 플랫폼을 단계적으로 확장했습니다. 익명화와 시각화를 바탕으로 개인정보를 보호하며 의사결정과 실행으로 연결했습니다.