AI
채널톡이 글로벌 상담 Agent를 GPT-5.6 Luna로 갈아탄 이유
두줄요약
글로벌 상담 AI Agent의 메인 모델을 GPT-5.6 Luna로 바꾼 이유를 자체 벤치마크로 설명했습니다. 공개 리더보드보다 실제 워크로드에서의 품질, 비용, 속도를 함께 보고 전환했습니다.
핵심 내용
- 글로벌 상담 AI Agent ALF의 메인 모델을 GPT-5.6 Luna로 전환한 배경과 판단 과정을 정리한 글
- 공개 리더보드보다 실제 상담 워크로드에 맞춘 자체 벤치마크가 더 중요하다는 관점 제시
- 능력 지표 5가지, 대표 케이스 통과율, 회귀 방지 통과율, 비용·레이턴시를 함께 비교해 후보를 걸러냄
- 최종적으로 품질, 비용, 속도 트레이드오프를 고려해 Luna high를 메인 응답 모델로 선택하고 점진 배포 진행
선택 이유
- 공개 벤치마크 상위권이더라도 실제 상담 흐름과 제약을 모두 반영하지 못함
- 멀티턴 대화, 근거 기반 답변, 툴 실행, 정책 준수, 정보 노출 방지 같은 상담 특화 요구가 핵심 기준
- Luna high는 대표 케이스와 회귀 방지, 비용과 속도를 함께 놓고 봤을 때 종합 우위를 보임
장단점
- 장점: 메인 모델 대비 통과율 개선, 재발 방지 수준 유지, 실행 비용 대폭 절감
- 단점: 모든 케이스에서 최상위는 아니며 일부 역전 케이스 존재
- 노력도에 따라 성능 편차가 커서 용도별 설정이 필요
적용해볼 점
- 공개 리더보드보다 실제 워크로드 기반 자체 평가 체계 우선
- 품질 지표와 운영 지표를 함께 보는 모델 전환 프로세스 구축
- 영향이 작은 영역부터 A/B 테스트와 단계적 배포로 검증
