목록 보기
Deduplication - 학습 데이터에서 중복 제거하기
AI

Deduplication - 학습 데이터에서 중복 제거하기

스캐터랩 핑퐁
스캐터랩 핑퐁
2023년 7월 10일

두줄요약

대규모 LLM 학습 데이터의 근접 중복을 효율적으로 제거하는 NearDedup 방식을 소개했습니다. LSH·자카드 유사도·편집 거리 필터를 Apache Beam으로 병렬 처리했습니다.

문제 상황

  • Luda Gen 1.5 학습용 대규모 외부 언어 데이터셋의 문서 중복과 수집 노이즈
  • 모든 문서 쌍의 편집 거리 계산에 따른 전체 데이터 길이 제곱 수준의 비현실적 연산량

구조와 흐름

  • LSH와 MinHash 기반의 유사 가능 문서 그룹화
  • 그룹 내부 문서 쌍의 자카드 유사도 0.8 이상 필터링
  • 편집 거리 유사도 0.8 이상 쌍에서 더 긴 문서 제거

선택 이유

  • 완전 일치뿐 아니라 재가공·수집 과정의 노이즈를 포함한 근접 중복 탐지
  • 고비용 편집 거리 계산 대상을 중복 가능성이 높은 쌍으로 한정
  • 광고 문구 등 추가 노이즈가 포함된 긴 문서보다 짧은 문서 보존

성능/운영 포인트

  • 각 처리 단계의 병렬화 가능성
  • Apache Beam 파이프라인 기반 LSH 그룹화, 쌍 생성, 중복 판별, 최종 제거

다음 읽기

#LLM 주제를 이어서 읽기

Luda Gen 1, 더 재미있고 자연스러운 대화로 돌아온 루다 2편 - 생성 모델을 챗봇으로 빚어내기

생성 챗봇의 단답형·페르소나·안전성 문제를 좋은 응답 기준과 추가학습으로 개선했습니다. SFT와 스타일 제어를 평가해 품질과 안전성 균형이 높은 SFT를 백본으로 선택했습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...