
AI
리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
두줄요약
공개 리더보드만으로는 토스 서비스에 맞는 LLM을 고르기 어려워 Toss Benchmark를 구축했습니다. 한국어 입력, 추론 설정, 도메인 지식과 정책 준수까지 함께 평가해 실제 업무 적합성을 확인했습니다.
핵심 내용
- 공개 리더보드 순위만으로는 토스 서비스 적합한 LLM을 판단하기 어려워 Toss Benchmark를 구축
- 한국어 입력 여부와 Reasoning 설정 변화에 따라 모델 순위와 성능 하락 폭이 달라짐을 확인
- 범용 성능 외에 토스 도메인 정책 준수와 지식 평가를 분리해 실제 업무와의 연관성을 점검
- 벤치마크 결과를 모델 카탈로그와 Foundation 모델 개발 기준에 활용하는 흐름 제시
구조와 흐름
- 한국어 범용 성능과 토스 도메인 성능을 함께 평가하는 기준 설계
- Toss IFBench로 형식 지시와 판단 지시의 정책 준수 능력 측정
- Toss Knowledge로 커머스 중심 도메인 지식 측정
- 공개 지표와 운영 태스크의 상관관계를 비교해 평가 타당성 검증
선택 이유
- 영어 리더보드 상위 모델이 한국어 서비스에서도 우수하다는 보장 부재
- Reasoning 모드 유무에 따라 서비스 환경에서의 적합성 변화
- 상품 카탈로그, 상담, 광고 검수 등 토스 업무는 범용 벤치마크와 다른 능력 요구
- 실제 업무 프롬프트와 데이터에 맞춘 비교 기준 필요

