비용과 성능을 한번에 - 언어 특화 토크나이저 도입기
두줄요약
한국어·일본어 전용 토크나이저를 기존 LLM 백본에 이식해 토큰 효율을 개선했습니다. 실서비스 A/B에서 GPU 사용량과 응답 지연을 줄이고 이용 시간을 높였습니다.
문제 상황
- 다국어 공용 토크나이저의 영어 중심 어휘 배분으로 한국어·일본어 토큰 수 증가와 임베딩 낭비
- 자모 표현과 대화체가 바이트 단위로 분절되며 응답 지연과 길이 상한 중단 발생
해결 방법
- 기존 어휘 크기와 백본 규모를 유지한 한국어·일본어 전용 BPE 토크나이저 설계
- 서비스 대화 로그·서사 텍스트·프롬프트 형식·소량 영어를 조합한 언어별 20억 자 코퍼스 학습
- 기존 토큰 조각의 임베딩 평균 초기화, 임베딩 워밍업 후 continued pre-training 적용
성능/운영 포인트
- 일본어 A/B에서 입력 토큰 34%, 출력 토큰 45%, 응답 지연 52% 감소와 이용 시간 유지
- 프로덕션 A/B에서 이용 시간 7.3~8.2% 증가, GPU pod-hour 46% 감소, D7 리텐션 상승
- 전체 배포 후 동시 유저 수 설정 1.8배 상향과 GPU pod-hour 41% 절감
주의할 점
- 토크나이저가 다른 모델 간 토큰당 loss 비교 대신 글자당 NLL 또는 bits-per-byte 기준 활용
- 대화 코퍼스 비중 확대 시 대화 효율과 장문 서사 효율 간 트레이드오프
- 반복 응답 증가 문제를 nucleus sampling의 top_p 0.8에서 1.0 조정으로 완화



