국내 IT 기업 기술 블로그 최신 글

NEW FEATURE

기술을 읽던 곳에서, 다음 기회를 만나세요.

채용 검색부터 관심사 기반 추천, 내 적합도까지.

새로운 기술 블로그가 추가되었어요

필터 1
Oozie/Sqoop에서 Airflow/Spark로: 데이터 파이프라인 전환기
SK플래닛
백엔드

Oozie/Sqoop에서 Airflow/Spark로: 데이터 파이프라인 전환기

Oozie/Sqoop 기반 데이터 파이프라인을 Airflow/Spark로 전환한 사례를 정리했습니다.\nYAML 템플릿, 동적 파티셔닝, Parquet 최적화로 운영성과 조회 성능을 함께 개선했습니다.

#Airflow#Spark
1400
80TB 데이터 비용 10배 절감기: DynamoDB에서 Apache Iceberg로의 여정 - Part 1
밸런스히어로
아키텍처

80TB 데이터 비용 10배 절감기: DynamoDB에서 Apache Iceberg로의 여정 - Part 1

80TB 이중 저장 구조를 S3 기반 Iceberg 단일 테이블로 통합해 비용을 1/10로 낮추는 과정을 정리했습니다. Rowgroup, 버켓, 컴팩션, 파티션 조합으로 조회 파일 수를 크게 줄였습니다.

#DynamoDB#Apache Iceberg
1400
제조업 데이터를 활용한 BI 대시보드 통합 및 자동화 후기
데보션
백엔드

제조업 데이터를 활용한 BI 대시보드 통합 및 자동화 후기

Airflow와 PySpark로 제조업 기준 정보와 생산 데이터를 통합해 Spotfire 대시보드를 자동화했습니다.\n대용량 처리와 정기 갱신으로 현장 의사결정 속도와 데이터 신뢰성을 높였습니다.

#Airflow#PySpark
7500
NELO Alaska: 대용량 로그 데이터 저장을 위한 Apache Iceberg 도입기
네이버 D2
백엔드

NELO Alaska: 대용량 로그 데이터 저장을 위한 Apache Iceberg 도입기

Elasticsearch 기반 로그 저장 구조의 비용과 확장성 한계를 해결하기 위해 Iceberg 기반 Alaska를 도입했습니다. Kafka 로그를 오브젝트 스토리지에 직접 적재하고, 실시간 조회와 장기 보관을 분리해 운영 효율을 높였습니다.

#Apache Iceberg#Elasticsearch
11400
Trino로 타임아웃 개선하기
NHN
백엔드

Trino로 타임아웃 개선하기

로그 누적으로 발생한 대시보드 타임아웃과 slow query 문제를 Trino 도입으로 개선한 사례를 다뤘습니다. OBS와 Parquet, MySQL tier down 구조를 통해 집계 성능과 저장 효율을 함께 고려했습니다.

#Trino#MySQL
4000
ETL 성능 향상을 위한 몇 가지 팁들
NC소프트 DANBI
백엔드

ETL 성능 향상을 위한 몇 가지 팁들

HiveQL과 RDBMS 쿼리 구조를 개선해 ETL 처리 성능을 높이는 방법을 소개했습니다. 데이터 검증, 로그, 스케줄링을 통한 안정적인 ETL 운영 방식도 정리했습니다.

#ETL#HiveQL
4100
Apache Spark에서 컬럼 기반 저장 포맷 Parquet(파케이) 제대로 활용하기
타다
백엔드

Apache Spark에서 컬럼 기반 저장 포맷 Parquet(파케이) 제대로 활용하기

Spark 로그 저장 포맷을 JSON에서 Parquet로 전환하고 인코딩 옵션을 조정했습니다. 저장 용량을 74% 줄이고 쿼리 성능을 10~30배 높였습니다.

#Apache Spark#Parquet
2400