Deduplication - 학습 데이터에서 중복 제거하기
대규모 LLM 학습 데이터의 근접 중복을 효율적으로 제거하는 NearDedup 방식을 소개했습니다. LSH·자카드 유사도·편집 거리 필터를 Apache Beam으로 병렬 처리했습니다.
#LLM#Apache Beam#LSH
000
데이터셋 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.
2개 표시
대규모 LLM 학습 데이터의 근접 중복을 효율적으로 제거하는 NearDedup 방식을 소개했습니다. LSH·자카드 유사도·편집 거리 필터를 Apache Beam으로 병렬 처리했습니다.
EMNLP 2022의 NLP 논문 14편을 대화, 검색, 생성, 평가, 데이터셋 관점에서 리뷰했습니다. 프롬프트·LLM·멀티모달 학습의 성과와 개인정보, 비용, 데이터 품질 이슈를 함께 다뤘습니다.