Deduplication - 학습 데이터에서 중복 제거하기
두줄요약
대규모 LLM 학습 데이터의 근접 중복을 효율적으로 제거하는 NearDedup 방식을 소개했습니다. LSH·자카드 유사도·편집 거리 필터를 Apache Beam으로 병렬 처리했습니다.
문제 상황
- Luda Gen 1.5 학습용 대규모 외부 언어 데이터셋의 문서 중복과 수집 노이즈
- 모든 문서 쌍의 편집 거리 계산에 따른 전체 데이터 길이 제곱 수준의 비현실적 연산량
구조와 흐름
- LSH와 MinHash 기반의 유사 가능 문서 그룹화
- 그룹 내부 문서 쌍의 자카드 유사도 0.8 이상 필터링
- 편집 거리 유사도 0.8 이상 쌍에서 더 긴 문서 제거
선택 이유
- 완전 일치뿐 아니라 재가공·수집 과정의 노이즈를 포함한 근접 중복 탐지
- 고비용 편집 거리 계산 대상을 중복 가능성이 높은 쌍으로 한정
- 광고 문구 등 추가 노이즈가 포함된 긴 문서보다 짧은 문서 보존
성능/운영 포인트
- 각 처리 단계의 병렬화 가능성
- Apache Beam 파이프라인 기반 LSH 그룹화, 쌍 생성, 중복 판별, 최종 제거


