AI 안전 다이제스트

2024-08-07 · 1건

🇺🇸 METR의 GPT-4o 예비 평가 세부 내용 (2024.8.7)

공공 · METR · 🔒

METR은 GPT-4o 모델의 자율 능력 평가를 위한 방법론을 설명하며, 이 평가는 소프트웨어 엔지니어링, 사이버 보안, 머신 러닝 등 다양한 분야의 77개 작업을 통해 수행되었습니다. 평가 결과, GPT-4o는 다른 모델들(Claude 3 Sonnet, GPT-4-Turbo)보다 우수한 성능을 보였으나, 인간 수준의 성능에는 다소 미치지 못했습니다. 특히, GPT-4o는 효율적인 피드백 활용과 체계적인 탐색 능력을 보였지만, 갑작스러운 결론 도출 중단이나 무의미한 출력 등의 실패 모드를 겪었습니다. 평가에서 발견된 오류의 약 절반은 태스크 무관한 개선 방법으로 해결 가능하다고 판단되었습니다. 또한, 특정 오류 모드를 수동으로 수정한 실험에서는 성공률이 향상되는 것을 확인하였습니다. 평가는 현재 진행 중인 연구의 일부로, 모델의 일반 능력을 측정하고 인간과 비교하는 방법을 탐색하고 있습니다.