목록 보기
비용과 성능을 한번에 - 언어 특화 토크나이저 도입기
AI

비용과 성능을 한번에 - 언어 특화 토크나이저 도입기

스캐터랩 핑퐁
스캐터랩 핑퐁
2026년 8월 31일

두줄요약

한국어·일본어 전용 토크나이저를 기존 LLM 백본에 이식해 토큰 효율을 개선했습니다. 실서비스 A/B에서 GPU 사용량과 응답 지연을 줄이고 이용 시간을 높였습니다.

문제 상황

  • 다국어 공용 토크나이저의 영어 중심 어휘 배분으로 한국어·일본어 토큰 수 증가와 임베딩 낭비
  • 자모 표현과 대화체가 바이트 단위로 분절되며 응답 지연과 길이 상한 중단 발생

해결 방법

  • 기존 어휘 크기와 백본 규모를 유지한 한국어·일본어 전용 BPE 토크나이저 설계
  • 서비스 대화 로그·서사 텍스트·프롬프트 형식·소량 영어를 조합한 언어별 20억 자 코퍼스 학습
  • 기존 토큰 조각의 임베딩 평균 초기화, 임베딩 워밍업 후 continued pre-training 적용

성능/운영 포인트

  • 일본어 A/B에서 입력 토큰 34%, 출력 토큰 45%, 응답 지연 52% 감소와 이용 시간 유지
  • 프로덕션 A/B에서 이용 시간 7.3~8.2% 증가, GPU pod-hour 46% 감소, D7 리텐션 상승
  • 전체 배포 후 동시 유저 수 설정 1.8배 상향과 GPU pod-hour 41% 절감

주의할 점

  • 토크나이저가 다른 모델 간 토큰당 loss 비교 대신 글자당 NLL 또는 bits-per-byte 기준 활용
  • 대화 코퍼스 비중 확대 시 대화 효율과 장문 서사 효율 간 트레이드오프
  • 반복 응답 증가 문제를 nucleus sampling의 top_p 0.8에서 1.0 조정으로 완화

다음 읽기

#LLM 주제를 이어서 읽기

매주 새로운 LLM 모델을 배포하는 제타의 AI 팀 이야기

제타 AI팀은 대화 기억력과 서사적 몰입을 개선하며 자체 LLM을 빠르게 배포했습니다.\n사용자 피드백을 학습에 반영하는 Data Flywheel과 A/B 테스트로 재미를 검증합니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...