
리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
공개 리더보드만으로는 토스 서비스에 맞는 LLM을 고르기 어려워 Toss Benchmark를 구축했습니다. 한국어 입력, 추론 설정, 도메인 지식과 정책 준수까지 함께 평가해 실제 업무 적합성을 확인했습니다.
새로운 기술 블로그가 추가되었어요

공개 리더보드만으로는 토스 서비스에 맞는 LLM을 고르기 어려워 Toss Benchmark를 구축했습니다. 한국어 입력, 추론 설정, 도메인 지식과 정책 준수까지 함께 평가해 실제 업무 적합성을 확인했습니다.

RAG가 기대만큼 답하지 못하는 문제를 다룹니다. 성공 요인을 LLM보다 문서 중앙화와 데이터에서 찾습니다.

사내에서 쓰는 Codex와 Claude를 LLM 서버 형태로 전환해 시스템에 넣어 활용하는 방법을 다룹니다. 웹, 앱, CLI에 흩어진 사용 방식을 내부 연동 관점에서 정리했습니다.

LLM 번역이 다음 토큰 예측과 다국어 학습을 통해 작동하는 방식을 설명했습니다. NMT와 비교해 문맥·지시 반영의 강점과 속도·일관성 한계를 짚었습니다.

Galaxy Watch 검증 단계의 Crash·ANR·화면 흑화 이슈 초도 분석을 자동화한 WOA Agent 개발기를 소개했습니다. AI에 분석을 맡기기 전에 분석 불가 판단부터 학습시키는 접근을 다뤘습니다.

Tech-Verse 2026에서 AI 주도 개발과 AX 전환의 핵심 흐름을 살펴보았습니다. 모델보다 환경·검증·설계가 중요하다는 실무 관점을 중심으로 정리했습니다.
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.


Oracle에서 PostgreSQL로의 마이그레이션에서 가장 큰 병목인 저장 프로시저 변환을 멀티 에이전트 GAMMA로 자동화하는 내용을 다뤘습니다. 의존성 분석, 코드 생성, 검증, 지식 축적을 결합해 수동 작업을 줄이고 정확도를 높이는 방법을 소개했습니다.


LLM이 문서를 읽는 순서와 우선순위를 정리하는 Wiki 구조를 소개했습니다. VUI 디자인 시스템 작업에서 검증과 생성에 어떻게 활용했는지도 사례로 설명했습니다.

AI 시대에는 엔진보다 워크플로우를 바꾸는 기업이 성과를 내고 있습니다. 버티컬 AI와 기존 기업의 전환 사례, 그리고 단위경제와 운영 준비의 중요성을 정리했습니다.

전화 상담에서는 무엇을 말할지뿐 아니라 언제 말할지도 중요하다고 다루었습니다. Voice Turn Detection 모델을 만들어 100ms대 판단과 실제 전화 적용 결과를 소개했습니다.

AI가 개인의 하루와 업무 맥락을 기억하도록 하기 위해 개인 LLM 위키를 만든 사례를 다뤘습니다. 먼저 기억할 곳을 마련하는 과정을 중심으로 소개했습니다.

Amazon EKS의 GPU 한 장에서 Gemma 4 31B를 vLLM으로 서빙할 때의 처리량과 지연 SLO 최적화 결과를 정리했습니다. NVFP4, prefix caching, speculative decoding, priority 스케줄링의 효과와 서빙 풀 분리 기준을 제시했습니다.

Amazon EKS에서 vLLM으로 Gemma 4 31B 서빙의 콜드 스타트를 단계별로 최적화한 사례입니다. S3 직결 로더, 캐시 영속화, sleep mode로 시작 시간과 GPU 비용을 줄였습니다.


스크럼에서 반복되던 유저스토리 작성과 점수 참고 과정을 줄이기 위해 AI 기능을 도입한 과정을 공유했습니다. 생성과 검색을 분리하고, 실제 사용 중 드러난 문제를 바탕으로 구조를 계속 조정했습니다.