목록 보기
채널톡이 글로벌 상담 Agent를 GPT-5.6 Luna로 갈아탄 이유
AI

채널톡이 글로벌 상담 Agent를 GPT-5.6 Luna로 갈아탄 이유

채널톡
채널톡
2026년 8월 24일

두줄요약

글로벌 상담 AI Agent의 메인 모델을 GPT-5.6 Luna로 바꾼 이유를 자체 벤치마크로 설명했습니다. 공개 리더보드보다 실제 워크로드에서의 품질, 비용, 속도를 함께 보고 전환했습니다.

핵심 내용

  • 글로벌 상담 AI Agent ALF의 메인 모델을 GPT-5.6 Luna로 전환한 배경과 판단 과정을 정리한 글
  • 공개 리더보드보다 실제 상담 워크로드에 맞춘 자체 벤치마크가 더 중요하다는 관점 제시
  • 능력 지표 5가지, 대표 케이스 통과율, 회귀 방지 통과율, 비용·레이턴시를 함께 비교해 후보를 걸러냄
  • 최종적으로 품질, 비용, 속도 트레이드오프를 고려해 Luna high를 메인 응답 모델로 선택하고 점진 배포 진행

선택 이유

  • 공개 벤치마크 상위권이더라도 실제 상담 흐름과 제약을 모두 반영하지 못함
  • 멀티턴 대화, 근거 기반 답변, 툴 실행, 정책 준수, 정보 노출 방지 같은 상담 특화 요구가 핵심 기준
  • Luna high는 대표 케이스와 회귀 방지, 비용과 속도를 함께 놓고 봤을 때 종합 우위를 보임

장단점

  • 장점: 메인 모델 대비 통과율 개선, 재발 방지 수준 유지, 실행 비용 대폭 절감
  • 단점: 모든 케이스에서 최상위는 아니며 일부 역전 케이스 존재
  • 노력도에 따라 성능 편차가 커서 용도별 설정이 필요

적용해볼 점

  • 공개 리더보드보다 실제 워크로드 기반 자체 평가 체계 우선
  • 품질 지표와 운영 지표를 함께 보는 모델 전환 프로세스 구축
  • 영향이 작은 영역부터 A/B 테스트와 단계적 배포로 검증

다음 읽기

#RAG 주제를 이어서 읽기

채널 AI팀은 왜 새로운 ML 모델 벤치마크가 필요로 했을까?

AI 모델 성능 비교를 위해 상담 도메인에 맞는 리트리벌 벤치마크를 직접 제작했습니다. 벡터 검색과 BM25를 결합한 하이브리드 검색의 개선 효과도 정량적으로 확인했습니다.

채널톡
채널톡
AI

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...