모든 태그
태그

Hive 기술 블로그 글

Hive 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.

전체 8개최신 8개 표시
홈에서 필터

최신 게시글

8개 표시

백엔드

Hive는 잊으려 했지만, Spark는 기억하고 있었다: 사라진 get_table RPC 복원기

Hive 4.2에서 제거된 get_table RPC로 Spark 잡이 실패한 원인을 추적했습니다.\nThrift IDL 계약을 보존한 RPC 복원과 생성 코드 검증 방식을 정리했습니다.

#Hive#Spark#Thrift
1500

백엔드

Oozie/Sqoop에서 Airflow/Spark로: 데이터 파이프라인 전환기

Oozie/Sqoop 기반 데이터 파이프라인을 Airflow/Spark로 전환한 사례를 정리했습니다.\nYAML 템플릿, 동적 파티셔닝, Parquet 최적화로 운영성과 조회 성능을 함께 개선했습니다.

#Airflow#Spark#Parquet
1400

백엔드

Iceberg는 정말 싸고 빠를까? – 운영 데이터 5가지 벤치마크 솔직한 결과

실제 운영 데이터로 Iceberg와 Hive를 비교해 비용과 속도 차이를 검증했습니다. 큰 테이블부터 옮기고 SQL 패턴을 바꿔야 효과가 커졌습니다.

#Apache Iceberg#Athena#PySpark
5300

아키텍처

실시간 유효 광고 선정을 위한 Flink에서 Apache Paimon 도입기

Flink와 Apache Paimon으로 실시간 유효 광고 선정 파이프라인을 구축한 사례를 소개했습니다. 실시간 처리 보장, 조인, 타임 트래블, 자동 compaction 같은 Paimon 활용 포인트를 정리했습니다.

#Apache Flink#Apache Paimon#Spark
13200

백엔드

스케일 넘치는 대용량 감사 로그, 스마트하게 관리하기 (OVEN)

대용량 감사 로그를 HotStore와 ColdStore로 분리해 효율적으로 저장하고 조회하는 구조를 소개했습니다. S3, Athena, Bloom Filter를 활용해 비용과 연동 복잡도를 줄이는 방안을 설명했습니다.

#S3#Athena#Hive
3100

백엔드

Spark Streaming을 활용한 파생 데이터 생성 시간 감축 사례

Hive 배치 기반 파생 데이터 생성 지연 문제를 Spark Streaming으로 실시간 처리하도록 전환한 사례를 소개했습니다. Kafka 오프셋과 처리량, LAG 모니터링으로 안정적인 운영 방법도 함께 설명했습니다.

#Spark#Kafka#Hive
4300

백엔드

효율적인 하둡 플랫폼 운영을 위한 “Hive 사용량 통계 레포트” 개발기

Hive 사용량 통계를 수집해 하둡 플랫폼 운영 효율을 높인 개발 사례를 소개했습니다. 크롤링 한계를 로그 분석과 실시간 처리 구조로 개선하고 Iceberg 적재 방식도 조정했습니다.

#Hive#Hadoop#Selenium
2200

백엔드

비트윈이 사용자를 분석하는 방법

비트윈은 Access Log를 기반으로 사용자 행동을 집계하고 분석 플랫폼을 단계적으로 확장했습니다. 익명화와 시각화를 바탕으로 개인정보를 보호하며 의사결정과 실행으로 연결했습니다.

#Hive#HBase#Scala
1400