Deduplication - 학습 데이터에서 중복 제거하기
대규모 LLM 학습 데이터의 근접 중복을 효율적으로 제거하는 NearDedup 방식을 소개했습니다. LSH·자카드 유사도·편집 거리 필터를 Apache Beam으로 병렬 처리했습니다.
#LLM#Apache Beam#LSH
000
LSH 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.
2개 표시
대규모 LLM 학습 데이터의 근접 중복을 효율적으로 제거하는 NearDedup 방식을 소개했습니다. LSH·자카드 유사도·편집 거리 필터를 Apache Beam으로 병렬 처리했습니다.
Reformer는 LSH Attention, Reversible Network, 청크 처리로 Transformer의 긴 입력 메모리 문제를 완화했습니다.\n실험을 통해 성능 저하를 작게 유지하며 Attention 복잡도를 선형 수준으로 개선했음을 살펴봤습니다.