목록 보기
과연 GPT-3는 얼마나 똑똑한 걸까?
AI

과연 GPT-3는 얼마나 똑똑한 걸까?

스캐터랩 핑퐁
스캐터랩 핑퐁
2020년 10월 20일

두줄요약

GPT-3를 57개 분야 문제로 평가한 벤치마크와 43.9% 정답률을 살펴봤습니다. 모델 규모와 과제 특화 학습이 성능·효율에 미치는 영향을 정리했습니다.

구조와 흐름

  • GLUE·SuperGLUE의 빠른 포화와 언어 AI 종합 능력 측정 한계
  • 57개 분야·15,908개 문항으로 구성된 MMLU형 다분야 객관식 벤치마크
  • 수학·법학·물리·의학 등 인간에게도 난도가 있는 지식·추론 문제 구성

성능/운영 포인트

  • 1,750억 파라미터 GPT-3의 정답률 43.9%, 무작위 기준 25% 상회
  • 인문·사회과학 대비 공학·자연과학 분야의 낮은 성능
  • 130억 파라미터 이하 모델의 무작위 수준 성능과 모델 크기 효과

선택 이유

  • 질의응답 특화 UnifiedQA의 39점과 GPT-3 대비 약 1/60 규모
  • 범용 모델보다 특화 학습·fine-tuning의 높은 효율성

적용해볼 점

  • 단일 언어 과제 점수보다 다분야·고난도 평가를 통한 종합 능력 검증
  • 모델 규모 확대와 과제 특화 학습 간 비용·성능 비교

다음 읽기

#GPT-3 주제를 이어서 읽기

GPT-3의 다섯 가지 한계

GPT-3의 과제별 성능, 물리 상식, 모델 규모, 기억 능력의 한계를 살펴봤습니다. 다음 단어 예측이 이해와 사고를 의미하는지에 대한 논쟁도 다뤘습니다.

스캐터랩 핑퐁
스캐터랩 핑퐁
AI

댓글 0개

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...