AI 모델의 성능, 우리는 제대로 평가하고 있을까?
AI
AI 모델의 성능, 우리는 제대로 평가하고 있을까?
두줄요약
AI 벤치마크는 학습 데이터 오염으로 인해 점수 신뢰성이 흔들릴 수 있다고 설명했습니다. 이를 해결하기 위해 Secure Enclave 기반의 Double-Blind Evaluation 방식과 시범 적용 사례를 소개했습니다.
핵심 내용
- AI 벤치마크는 모델 성능 비교에 널리 쓰이지만, 학습 데이터에 평가 문제가 섞이는 Benchmark Contamination으로 점수 신뢰성이 흔들릴 수 있음
- 비공개 평가를 하더라도 평가자와 모델 제공자 모두 서로의 비공개 자산을 노출하기 어려운 Dual Confidentiality Dilemma가 발생함
- Double-Blind Evaluation은 Secure Enclave와 Remote Attestation을 활용해 모델과 평가 데이터를 서로 직접 보지 못하게 하면서 독립 평가를 수행하는 방식
- DeepMind는 Gemini 2.5 Flash Lite와 비공개 안전성 벤치마크로 시범 적용했고, 향후 AI Safety와 검증 영역의 가능성을 제시함


