
AI
claude code의 reasoning effort는 vllm에도 효과가 있는가?
두줄요약
Claude Code의 reasoning effort가 vLLM에서 어떻게 전달되는지 소스코드로 확인했습니다. high 외 값은 대부분 max로 처리돼 실질적 제어 효과가 제한적이라고 정리했습니다.
핵심 내용
- Claude Code의 reasoning effort가 vLLM 기반 OSS 모델에서 실제로 어떻게 전달되는지 소스코드 레벨로 추적
- /messages 요청의 output_config.effort가 vLLM 내부에서 reasoning_effort로 변환되고, GLM 계열 템플릿의 system prompt에 반영
- high일 때만
Reasoning Effort: High가 들어가고, 그 외 값은 모두 max로 처리되어 세밀한 제어 효과가 제한적 - effort를 낮춰 토큰 소모를 줄이려는 기대와 달리 오히려 토큰 소모가 늘 수 있다는 점을 지적
