Deduplication - 학습 데이터에서 중복 제거하기
대규모 LLM 학습 데이터의 근접 중복을 효율적으로 제거하는 NearDedup 방식을 소개했습니다. LSH·자카드 유사도·편집 거리 필터를 Apache Beam으로 병렬 처리했습니다.
#LLM#Apache Beam#LSH
000
Apache Beam 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.
6개 표시
대규모 LLM 학습 데이터의 근접 중복을 효율적으로 제거하는 NearDedup 방식을 소개했습니다. LSH·자카드 유사도·편집 거리 필터를 Apache Beam으로 병렬 처리했습니다.
준실시간 수요예측을 위해 Apache Beam 기반 GCP Dataflow 파이프라인을 도입한 배경과 동작 구조를 설명했습니다. Flex 템플릿·CI/CD 배포 과정과 스트리밍, 권한, 비용 관련 운영 팁을 정리했습니다.

컬리의 준실시간 수요 예측 모델을 위해 Dataflow 파이프라인을 도입한 배경과 전체 동작 방식을 설명했습니다. Beam, Flex 템플릿, CI/CD, 권한 설정 등 실무 적용 포인트도 함께 정리했습니다.

Apache Beam RunInference로 Dataflow 기반 대규모 모델 추론 파이프라인을 구성하는 방법을 소개했습니다.\n가변 길이 입력의 패딩 처리와 배치·GPU 지표 관리 포인트를 설명합니다.
TFX 커스텀 컴포넌트로 신규 데이터부터 학습·모델 등록까지의 파이프라인을 구성했습니다. Apache Beam과 사내 레지스트리를 연동하는 구현·운영 주의점을 설명합니다.
Apache Beam 파이프라인을 Composite PTransform으로 모듈화하고 병렬 처리 병목을 최적화했습니다.\nShared Object, 배치, Side Input으로 ML 추론과 Faiss 벡터 검색의 메모리·처리 문제를 다뤘습니다.