국내 IT 기업 기술 블로그 최신 글

NEW FEATURE

기술을 읽던 곳에서, 다음 기회를 만나세요.

채용 검색부터 관심사 기반 추천, 내 적합도까지.

새로운 기술 블로그가 추가되었어요

필터 1
Talend Studio와 TAC를 이용한 ETL 데모
씨앤텍시스템즈
백엔드

Talend Studio와 TAC를 이용한 ETL 데모

Talend Studio로 Oracle 테이블 ETL Job을 만들고 tMap, tFilterRow, 타입 변환 기능을 살펴보았습니다. TAC에서 빌드한 Job을 등록해 스케줄링과 모니터링까지 관리하는 흐름을 소개했습니다.

#ETL#Talend Studio
1400
Airflow Task failed Alert Mail 폭탄 회피하기
네이버 플레이스
데브옵스

Airflow Task failed Alert Mail 폭탄 회피하기

Airflow에서 동일 원인으로 반복 발송되는 Task 실패 알림을 하나로 통합하는 방법을 다루었습니다. DAG run의 Task Instance와 로그를 활용해 중복 메일 노이즈를 줄이는 구현을 소개했습니다.

#Airflow#ETL
3400
Airflow 환경 Docker compose로 containerization하기
네이버 플레이스
데브옵스

Airflow 환경 Docker compose로 containerization하기

Airflow 개발 환경을 Docker compose로 컨테이너화해 배포와 유사한 상태에서 실행·디버깅할 수 있게 구성했습니다. PyCharm 연동, Executor 분리, 설정 통합으로 개발 생산성과 관리 편의도 높였습니다.

#Airflow#Docker
3100
원티드랩 데이터 마트 — 설립기
원티드
백엔드

원티드랩 데이터 마트 — 설립기

원티드랩의 데이터 마트 설계 과정을 ERD 작성부터 운영 규칙 정립까지 정리했습니다. BigQuery와 Airflow를 활용해 확장성과 품질을 높인 운영 방식도 소개했습니다.

#BigQuery#SQL
2400
랭킹 시스템 개편기
올리브영
백엔드

랭킹 시스템 개편기

기존 오라클 프로시저 기반 랭킹 시스템의 확장성과 운영 비효율을 해결하기 위해 신규 아키텍처를 설계했습니다. AWS Glue, Athena, Step Function을 활용해 서버리스 랭킹 파이프라인을 구성했습니다.

#AWS Glue#Athena
2600
분석 데이터를 프로덕션에서 쉽게 사용할 수 없을까?
뱅크샐러드
백엔드

분석 데이터를 프로덕션에서 쉽게 사용할 수 없을까?

분석 데이터를 프로덕션에서 쉽게 쓰기 위한 데이터서빙 서비스 구축 과정을 소개합니다. 분석 테이블을 API로 제공하기 위해 S3, Airflow, Spark 등을 활용했습니다.

#S3#Airflow
2300
쿠팡 파트너스

광고

개발자를 위한 서적을 확인해 보세요

이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

#개발서적#프로그래밍
Self Serving Data Platform 구축하기 (feat. Airflow)
버즈빌
백엔드

Self Serving Data Platform 구축하기 (feat. Airflow)

셀프 서빙 데이터 플랫폼을 구축한 사례를 소개했습니다. Airflow를 활용해 데이터 파이프라인 운영 부담을 줄이는 방향을 다뤘습니다.

#Airflow#ETL
2800
올리브영 데이터 엔지니어링
올리브영
데브옵스

올리브영 데이터 엔지니어링

올리브영은 IDC 기반 ETL·DW 구조를 GCP 기반 데이터 플랫폼으로 확장했습니다.\nAirflow·Spark·BigQuery로 데이터 수집·처리·분석과 로그 수집을 지원합니다.

#ETL#GCP
2300
Redshift DW에서 PG DM을 만드는 여정
매드업
백엔드

Redshift DW에서 PG DM을 만드는 여정

Athena와 Redshift 직접 조인의 비용·성능 문제를 데이터마트로 완화하려 했습니다.\nPostgreSQL dblink와 자동 생성 프로시저로 Redshift 데이터를 선별 동기화했습니다.

#Redshift#PostgreSQL
2400
ETL 성능 향상을 위한 몇 가지 팁들
NC소프트 DANBI
백엔드

ETL 성능 향상을 위한 몇 가지 팁들

HiveQL과 RDBMS 쿼리 구조를 개선해 ETL 처리 성능을 높이는 방법을 소개했습니다. 데이터 검증, 로그, 스케줄링을 통한 안정적인 ETL 운영 방식도 정리했습니다.

#ETL#HiveQL
4100
ETL 개념과 ETL 개발 시 고려해야 하는 원칙들
NC소프트 DANBI
백엔드

ETL 개념과 ETL 개발 시 고려해야 하는 원칙들

ETL의 추출·변환·적재 흐름과 데이터 웨어하우스에서의 역할을 정리했습니다. 멱등성, 점진 적재, 파티셔닝, 테스트와 모니터링 원칙을 제시했습니다.

#ETL#데이터 웨어하우스
2900
제품 팀 2020년 회고
엔라이즈
데브옵스

제품 팀 2020년 회고

제품 팀은 전원 원격근무 전환과 적극적 소통으로 업무 수행 역량을 유지했습니다. 데이터 파이프라인을 개선하고 위피 해외 실험과 콰트 앱·웹 출시를 진행했습니다.

#원격근무#DataLake
1700
Airflow를 활용하여 아름다운 데이터 파이프라인 구성하기 / if(kakao)2019
카카오엔터테인먼트FE
데브옵스

Airflow를 활용하여 아름다운 데이터 파이프라인 구성하기 / if(kakao)2019

Airflow의 주요 개념과 아키텍처, 데이터 파이프라인 구성 방법을 소개했습니다. 유사 워크플로 관리 도구와 비교해 카카오페이지의 선택 및 운영 방식을 설명했습니다.

#Airflow#ETL
000
Apache Spark에서 컬럼 기반 저장 포맷 Parquet(파케이) 제대로 활용하기
타다
백엔드

Apache Spark에서 컬럼 기반 저장 포맷 Parquet(파케이) 제대로 활용하기

Spark 로그 저장 포맷을 JSON에서 Parquet로 전환하고 인코딩 옵션을 조정했습니다. 저장 용량을 74% 줄이고 쿼리 성능을 10~30배 높였습니다.

#Apache Spark#Parquet
2400