과연 GPT-3는 얼마나 똑똑한 걸까?
두줄요약
GPT-3를 57개 분야 문제로 평가한 벤치마크와 43.9% 정답률을 살펴봤습니다. 모델 규모와 과제 특화 학습이 성능·효율에 미치는 영향을 정리했습니다.
구조와 흐름
- GLUE·SuperGLUE의 빠른 포화와 언어 AI 종합 능력 측정 한계
- 57개 분야·15,908개 문항으로 구성된 MMLU형 다분야 객관식 벤치마크
- 수학·법학·물리·의학 등 인간에게도 난도가 있는 지식·추론 문제 구성
성능/운영 포인트
- 1,750억 파라미터 GPT-3의 정답률 43.9%, 무작위 기준 25% 상회
- 인문·사회과학 대비 공학·자연과학 분야의 낮은 성능
- 130억 파라미터 이하 모델의 무작위 수준 성능과 모델 크기 효과
선택 이유
- 질의응답 특화 UnifiedQA의 39점과 GPT-3 대비 약 1/60 규모
- 범용 모델보다 특화 학습·fine-tuning의 높은 효율성
적용해볼 점
- 단일 언어 과제 점수보다 다분야·고난도 평가를 통한 종합 능력 검증
- 모델 규모 확대와 과제 특화 학습 간 비용·성능 비교
