Apache Airflow 3.x 무엇이 달라졌고, 어디로 가고 있는가?
Airflow 3.x는 실행과 오케스트레이션을 분리하고, 시간 중심 스케줄링을 Asset·이벤트 중심으로 확장했습니다.\nDAG 버저닝과 `airflow.sdk`로 안정성과 추적성을 높이며 범용 워크플로우 플랫폼으로 이동했습니다.

Airflow 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.
20개 표시
Airflow 3.x는 실행과 오케스트레이션을 분리하고, 시간 중심 스케줄링을 Asset·이벤트 중심으로 확장했습니다.\nDAG 버저닝과 `airflow.sdk`로 안정성과 추적성을 높이며 범용 워크플로우 플랫폼으로 이동했습니다.

Oozie/Sqoop 기반 데이터 파이프라인을 Airflow/Spark로 전환한 사례를 정리했습니다.\nYAML 템플릿, 동적 파티셔닝, Parquet 최적화로 운영성과 조회 성능을 함께 개선했습니다.
Airflow task 실행에서 필요한 병렬성과 격리성을 설명하고, fork와 spawn의 차이를 비교했습니다. Airflow 3가 성능상 fork를 채택한 이유와 프로세스 구조도 정리했습니다.
Airflow 3 전환 후 새벽 배치 장애를 겪었지만, 원인은 JWT 만료가 아니라 OOM이었습니다. 로그 해석과 함께 메모리 사용량까지 확인해야 한다는 점을 정리했습니다.
흩어진 클라우드 운영 데이터를 하나의 기준으로 모으기 위해 레이크하우스 기반 통합 플랫폼 Deck 구축 과정을 소개했습니다. Object Storage를 SSOT로 두고 레이어를 분리해 과금과 분석의 신뢰성을 높였습니다.
실제 운영 데이터로 Iceberg와 Hive를 비교해 비용과 속도 차이를 검증했습니다. 큰 테이블부터 옮기고 SQL 패턴을 바꿔야 효과가 커졌습니다.
Iceberg 운영에서 스냅샷 폭증과 Small File 문제를 어떻게 다뤘는지 정리했습니다. 작업 이력 관리와 메인터넌스 정책으로 비용과 성능을 개선한 사례입니다.
200개 이상 DB를 BigQuery로 옮기던 ELT 운영 문제를 DT Platform으로 분리·표준화했습니다. UI와 DSL, 자동 마이그레이션으로 리드타임과 리뷰 병목을 줄였습니다.
Airflow DAG 파싱 최적화는 메트릭 기반 측정과 설정 튜닝, 코드 위생 점검이 핵심입니다. 특히 Airflow 3.x의 설정 이동과 ignore 문법 변경을 함께 확인해야 했습니다.

배송 완료 사진 임베딩의 거리 비교로 오배송을 탐지하는 장소 재인식 시스템을 구축했습니다. ONNX 기반 온디바이스 추론과 배치 임베딩 적재로 실시간성과 운영 효율을 확보했습니다.

Apache Flink와 RocksDB 튜닝으로 광고 Frequency Capping 실시간 집계를 7일 구간까지 확장한 사례를 다루었습니다. 세 개의 Flink 앱으로 분리해 병목을 각각 해결하고 Redis 단일 조회 구조로 단순화했습니다.

Astronomer Agents는 Airflow API와 로그를 활용해 Dag 개발, 테스트, 디버깅을 돕는 AI 도구입니다. 또한 마이그레이션과 데이터 분석까지 지원해 운영 효율을 높였습니다.

운영 DB 중심 분석의 한계를 넘기 위해 S3, Athena, Airflow, dbt 기반 데이터 환경을 구축했습니다.\nAI skill로 소스 연결, 모델링, 문서화를 자동화하며 실무 생산성을 높였습니다.
Astronomer Agents로 Airflow 작업의 작성, 테스트, 디버깅 방식이 달라질 수 있음을 소개했습니다. 또한 마이그레이션과 데이터 웨어하우스 분석까지 지원하는 핵심 기능을 설명했습니다.

카라트는 사용자 활성화 분석을 공통 Activation Layer로 표준화했습니다. 팀별 ad hoc 쿼리 대신 DBT 기반 모델로 신뢰성과 운영 안정성을 높였습니다.
당근이 User Activation을 전사 공통 데이터 레이어로 만든 배경과 구조를 설명했습니다. 상태와 전이 분석을 위해 신뢰성, 비용, 생산성을 함께 고려한 설계였습니다.
토스 Business Data Team이 사업자 데이터를 통합해 SSOT 마트를 만들고 월간 리포트를 발행한 과정을 공유했습니다. 전사 지표를 맞추고 인사이트를 제공해 데이터 활용과 리터러시를 높인 사례입니다.
Karrot 데이터팀이 BigQuery SQL 로그를 파싱해 컬럼 단위 데이터 계보를 구축한 과정을 소개했습니다. 테이블 단위 한계를 보완하고 영향 분석과 PII 추적을 정교하게 만든 사례입니다.
BigQuery 쿼리 로그를 SQL 파싱해 컬럼 레벨 리니지를 구축한 사례를 소개했습니다. 테이블·컬럼 의존 관계를 빠르게 추적해 데이터 신뢰성과 운영 효율을 높였습니다.
DBT와 Airflow로 데이터 계보 중심 파이프라인 Flow.er를 구축한 사례를 소개했습니다. 운영 비용 절감과 조직 확장을 위한 구성 요소와 개선 경험을 공유했습니다.