🇺🇸 METR의 OpenAI o1-preview 초기 평가 결과 (2024.9.12)
METR은 2024년 8월 28일부터 9월 3일까지 OpenAI의 o1-mini와 o1-preview 모델에 대한 평가를 진행했습니다. 평가 기간 동안 일반 자율성과 AI 연구 능력을 중점적으로 평가했습니다. 평가 결과, o1-mini와 o1-preview 모델은 공개된 최고 모델인 Claude 3.5 Sonnet보다 높지 않은 성능을 보였지만, 질적으로 강한 추론과 계획 능력, 적은 반복 횟수로도 성능 향상을 보인 점 등 잠재력이 확인되었습니다. 특히, 적절한 에이전트 구조 내에서는 이 모델들이 Claude 3.5 Sonnet과 유사한 성능을 보였으며, o1-preview 모델은 복잡한 AI 연구 작업의 일부에서 진전을 이루었습니다. 평가 과정에서 시간 제약과 API 접근 제한 등으로 인해 더 세밀한 평가의 여지가 있음을 확인했습니다.