AI 안전 다이제스트

2024-08-06 · 1건

🇺🇸 METR의 일반 자율성 평가 업데이트 (2024.8.6)

공공 · METR · 📋🔒

METR은 자율성 평가 자원을 출시한 이후 주로 AI 역량 측정 방법 개발에 집중해 왔습니다. 현재는 AI 연구개발 역량 평가와 일반적인 자율성 역량의 지속적인 측정을 위한 평가를 개발 중입니다. 이번 업데이트에서는 일반적인 자율성 역량 평가 개발에 대한 최근 노력을 다루며, 가까운 미래에 AI 연구개발 평가에 대한 업데이트를 제공할 계획이라고 밝혔습니다. 주요 내용은 다음과 같습니다:

- 다양한 능력 측정: 사이버 보안, 소프트웨어 엔지니어링, 머신 러닝 등 다양한 능력을 측정하는 약 50개의 자동 채점 과제를 개발했습니다. - 인간과 에이전트 성능 비교: GPT-4o와 클로에 모델을 평가한 결과, 고급 모델 기반 에이전트가 인간 기준선과 유사한 작업을 약 30분 내에 수행하는 것으로 나타났습니다. - 과제 난이도 평가: 인간 기준선을 기반으로 과제의 난이도를 평가하여, 과제의 난이도가 인간 기준선 수행 시간에 따라 로그 균일 분포를 이루도록 재가중했습니다. - 성능 한계: 현재 에이전트의 성능은 약 20만 토큰에서 한계를 보이는 것으로 확인되었습니다. - 비용 효율성: 에이전트는 수행 가능한 작업에서 인간보다 훨씬 저렴한 비용으로 작업을 수행할 수 있었습니다.

METR은 앞으로 더 많은 인간 기준선, 다양한 과제, 개선된 지침 및 평가 기법을 통해 일반 자율성 과제 스위트를 발전시킬 계획입니다. 이 연구는 최첨단 모델의 실제 영향을 예측하고 위험을 측정하며, 실증 데이터 기반의 합리적이고 적절한 정책 수립에 기여할 것으로 기대됩니다.