AI 안전 다이제스트

2024-11-22 · 1건

🇺🇸 METR 발표: AI 모델과 인간 전문가의 머신러닝 연구 엔지니어링 능력 평가 (2024.11.22)

공공 · METR · 🤖

METR은 RE-Bench라는 새로운 벤치마크를 공개하여 인간과 최첨단 언어 모델 에이전트의 머신러닝 연구 엔지니어링 작업 수행 능력을 측정합니다. 이 벤치마크는 7개의 환경으로 구성되어 있으며, 각 환경은 GPU 활용, 코드 최적화 등 실제 연구 엔지니어링 과제를 중심으로 설계되었습니다. 연구 결과, 2시간 내에서는 AI 에이전트가 인간보다 우수한 성과를 보였으나, 시간 예산이 늘어날수록 인간의 성과가 더 나았습니다. 특히, AI 에이전트는 특정 작업에서 인간보다 훨씬 빠르게 진전을 이루었지만, 복잡한 정보 처리와 장기적인 작업 진행에는 어려움을 겪었습니다. 이 연구는 자율 AI 연구 개발 능력을 평가하기 위한 기준 설정에 기여할 것으로 기대됩니다. 자세한 내용은 공개된 논문과 GitHub 리포지토리에서 확인 가능합니다.