목록 보기
리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
AI

리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기

토스
토스
2026년 9월 16일

두줄요약

공개 리더보드만으로는 토스 서비스에 맞는 LLM을 고르기 어려워 Toss Benchmark를 구축했습니다. 한국어 입력, 추론 설정, 도메인 지식과 정책 준수까지 함께 평가해 실제 업무 적합성을 확인했습니다.

핵심 내용

  • 공개 리더보드 순위만으로는 토스 서비스 적합한 LLM을 판단하기 어려워 Toss Benchmark를 구축
  • 한국어 입력 여부와 Reasoning 설정 변화에 따라 모델 순위와 성능 하락 폭이 달라짐을 확인
  • 범용 성능 외에 토스 도메인 정책 준수와 지식 평가를 분리해 실제 업무와의 연관성을 점검
  • 벤치마크 결과를 모델 카탈로그와 Foundation 모델 개발 기준에 활용하는 흐름 제시

구조와 흐름

  • 한국어 범용 성능과 토스 도메인 성능을 함께 평가하는 기준 설계
  • Toss IFBench로 형식 지시와 판단 지시의 정책 준수 능력 측정
  • Toss Knowledge로 커머스 중심 도메인 지식 측정
  • 공개 지표와 운영 태스크의 상관관계를 비교해 평가 타당성 검증

선택 이유

  • 영어 리더보드 상위 모델이 한국어 서비스에서도 우수하다는 보장 부재
  • Reasoning 모드 유무에 따라 서비스 환경에서의 적합성 변화
  • 상품 카탈로그, 상담, 광고 검수 등 토스 업무는 범용 벤치마크와 다른 능력 요구
  • 실제 업무 프롬프트와 데이터에 맞춘 비교 기준 필요

다음 읽기

#LLM 주제를 다룬 다른 회사 글

채널톡이 글로벌 상담 Agent를 GPT-5.6 Luna로 갈아탄 이유

글로벌 상담 AI Agent의 메인 모델을 GPT-5.6 Luna로 바꾼 이유를 자체 벤치마크로 설명했습니다. 공개 리더보드보다 실제 워크로드에서의 품질, 비용, 속도를 함께 보고 전환했습니다.

채널톡
채널톡
AI

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...