The Machine: AI가 AI 활용 코드를 평가하다
AI
The Machine: AI가 AI 활용 코드를 평가하다
두줄요약
AI 코딩 에이전트를 대규모로 평가하기 위한 멀티 에이전트 하네스 설계를 다뤘습니다. 마크다운 지침과 JSON Schema로 재현성을 확보하고 기능과 깊이를 분리해 채점했습니다.
핵심 내용
- AI 코딩 에이전트 활용 과제를 대규모로 평가하기 위한 채용용 하네스와 멀티 에이전트 파이프라인 설계
- Git clone, 보안 스캔, 빌드, 테스트, 점수 산정, 랭크 분류, 알림까지 7단계로 자동화
- 마크다운 지침서와 JSON Schema로 재현성과 출력 형식을 고정하고, 단계별 결과를 저장해 재실행 가능성 확보
- 기능 점수와 코드/협업 깊이 점수를 분리한 3-Tier 모델과 7단계 랭크로 변별력 강화
적용해볼 점
- 에이전트의 실행 범위를 정하는 하네스와 구조화된 지침 설계
- 결과 검증을 위한 근거 제시, 스키마 검증, 재실행 가능한 단계별 저장 구조
- 기능과 사고의 깊이를 분리해 평가하는 이중 축 채점 방식