
Deduplication - 학습 데이터에서 중복 제거하기
대규모 LLM 학습 데이터의 근접 중복을 효율적으로 제거하는 NearDedup 방식을 소개했습니다. LSH·자카드 유사도·편집 거리 필터를 Apache Beam으로 병렬 처리했습니다.
#LLM#Apache Beam
000

대규모 LLM 학습 데이터의 근접 중복을 효율적으로 제거하는 NearDedup 방식을 소개했습니다. LSH·자카드 유사도·편집 거리 필터를 Apache Beam으로 병렬 처리했습니다.

Reformer는 LSH Attention, Reversible Network, 청크 처리로 Transformer의 긴 입력 메모리 문제를 완화했습니다.\n실험을 통해 성능 저하를 작게 유지하며 Attention 복잡도를 선형 수준으로 개선했음을 살펴봤습니다.