국내 IT 기업 기술 블로그 최신 글

NEW FEATURE

기술을 읽던 곳에서, 다음 기회를 만나세요.

채용 검색부터 관심사 기반 추천, 내 적합도까지.

새로운 기술 블로그가 추가되었어요

필터 1
Hive는 잊으려 했지만, Spark는 기억하고 있었다: 사라진 get_table RPC 복원기
네이버 D2
백엔드

Hive는 잊으려 했지만, Spark는 기억하고 있었다: 사라진 get_table RPC 복원기

Hive 4.2에서 제거된 get_table RPC로 Spark 잡이 실패한 원인을 추적했습니다.\nThrift IDL 계약을 보존한 RPC 복원과 생성 코드 검증 방식을 정리했습니다.

#Hive#Spark
1500
Oozie/Sqoop에서 Airflow/Spark로: 데이터 파이프라인 전환기
SK플래닛
백엔드

Oozie/Sqoop에서 Airflow/Spark로: 데이터 파이프라인 전환기

Oozie/Sqoop 기반 데이터 파이프라인을 Airflow/Spark로 전환한 사례를 정리했습니다.\nYAML 템플릿, 동적 파티셔닝, Parquet 최적화로 운영성과 조회 성능을 함께 개선했습니다.

#Airflow#Spark
1400
Iceberg는 정말 싸고 빠를까? – 운영 데이터 5가지 벤치마크 솔직한 결과
밸런스히어로
백엔드

Iceberg는 정말 싸고 빠를까? – 운영 데이터 5가지 벤치마크 솔직한 결과

실제 운영 데이터로 Iceberg와 Hive를 비교해 비용과 속도 차이를 검증했습니다. 큰 테이블부터 옮기고 SQL 패턴을 바꿔야 효과가 커졌습니다.

#Apache Iceberg#Athena
5300
실시간 유효 광고 선정을 위한 Flink에서 Apache Paimon 도입기
네이버 D2
아키텍처

실시간 유효 광고 선정을 위한 Flink에서 Apache Paimon 도입기

Flink와 Apache Paimon으로 실시간 유효 광고 선정 파이프라인을 구축한 사례를 소개했습니다. 실시간 처리 보장, 조인, 타임 트래블, 자동 compaction 같은 Paimon 활용 포인트를 정리했습니다.

#Apache Flink#Apache Paimon
13200
스케일 넘치는 대용량 감사 로그, 스마트하게 관리하기 (OVEN)
QueryPie
백엔드

스케일 넘치는 대용량 감사 로그, 스마트하게 관리하기 (OVEN)

대용량 감사 로그를 HotStore와 ColdStore로 분리해 효율적으로 저장하고 조회하는 구조를 소개했습니다. S3, Athena, Bloom Filter를 활용해 비용과 연동 복잡도를 줄이는 방안을 설명했습니다.

#S3#Athena
3100
Spark Streaming을 활용한 파생 데이터 생성 시간 감축 사례
SK플래닛
백엔드

Spark Streaming을 활용한 파생 데이터 생성 시간 감축 사례

Hive 배치 기반 파생 데이터 생성 지연 문제를 Spark Streaming으로 실시간 처리하도록 전환한 사례를 소개했습니다. Kafka 오프셋과 처리량, LAG 모니터링으로 안정적인 운영 방법도 함께 설명했습니다.

#Spark#Kafka
4300
쿠팡 파트너스

광고

개발자를 위한 서적을 확인해 보세요

이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

#개발서적#프로그래밍
효율적인 하둡 플랫폼 운영을 위한 “Hive 사용량 통계 레포트” 개발기
네이버 플레이스
백엔드

효율적인 하둡 플랫폼 운영을 위한 “Hive 사용량 통계 레포트” 개발기

Hive 사용량 통계를 수집해 하둡 플랫폼 운영 효율을 높인 개발 사례를 소개했습니다. 크롤링 한계를 로그 분석과 실시간 처리 구조로 개선하고 Iceberg 적재 방식도 조정했습니다.

#Hive#Hadoop
2200
비트윈이 사용자를 분석하는 방법
타다
백엔드

비트윈이 사용자를 분석하는 방법

비트윈은 Access Log를 기반으로 사용자 행동을 집계하고 분석 플랫폼을 단계적으로 확장했습니다. 익명화와 시각화를 바탕으로 개인정보를 보호하며 의사결정과 실행으로 연결했습니다.

#Hive#HBase
1400