METR는 공개 자율성 작업 스위트를 제공하며, 이 스위트는 10가지 작업 가족에 걸쳐 31개의 예시 작업과 더 넓은 범위의 186개 작업에 대한 요약 정보를 포함하고 있습니다. 주요 목표는 AI 에이전트의 위험한 자율 능력을 측정하는 평가 자료로 활용되는 것입니다. 작업들은 안전한 자율 능력 평가를 위한 한계와 완화 조치를 결정하는 데 사용됩니다. 작업 실행을 위해 METR Inspect Task Bridge 도구와 Docker 이미지를 사용할 수 있으며, 일부 작업은 로컬 파일과 제한된 인터넷 접근 조건 하에서 수행됩니다. 작업들은 MIT 라이선스 하에 공개되어 있으며, 솔루션의 무단 공유와 훈련 데이터로의 사용을 피하도록 요청하고 있습니다.
METR는 경계 모델의 잠재적으로 위험한 자율 기능을 평가하기 위한 자원 모음을 공유합니다. 이 자원들은 작업 모음, 소프트웨어 도구, 모델 능력을 정확하게 측정하기 위한 지침, 그리고 후 훈련 향상의 영향에 대한 연구 결과를 포함하고 있습니다. 또한, 위험한 자율 기능에 대한 전반적인 평가를 위한 예시 프로토콜도 제공하며, 이 프로토콜은 지속적으로 개선될 예정입니다. 피드백과 개선 제안은 언제든지 info@metr.org로 연락 가능합니다. 주요 내용은 다음과 같습니다:
- 작업 모음: 다양한 자율 능력을 포함한 예제 작업들로 구성되어 있으며, 난이도는 몇 분에서 며칠까지 다양합니다. 주로 소프트웨어 엔지니어링, 머신러닝 엔지니어링, 사이버 보안, 연구 분야에 초점을 맞춥니다.
- 능력 발현 지침: 모델 능력을 과소평가하는 위험을 줄이기 위한 평가자 지침을 제공합니다.
- 작업 표준 및 워크벤치: 코드로 작업 정의 방법과 간단한 예제 에이전트를 실행할 수 있는 기본적인 워크벤치를 포함합니다.
- 평가 프로토콜 예시: 전체 평가 과정을 설명하는 예시 프로토콜을 제공합니다.
- 후 훈련 효과 측정: GPT-4 모델의 성능 향상에 대한 초기 분석 결과를 포함합니다.
METR은 자율 인공지능 시스템의 자율성 관련 위험 평가를 위한 예시 프로토콜을 제시합니다. 이 프로토콜은 AI 모델의 위험 평가 능력을 실용적이고 비용 효율적으로 측정하며, 평가 결과에 따른 적절한 예방 조치를 구현하기 위한 지침을 포함합니다. 주요 목표는 자율 시스템의 치명적 위험을 의미 있게 제한하고, 사전에 명확하게 정의된 평가를 통해 사회적 감독이 가능하도록 하는 것입니다. 프로토콜은 다양한 난이도의 작업을 통해 모델의 능력을 평가하고, 이를 통해 위험 지표를 연속적으로 측정하여 개발 과정에서의 위험 관리를 돕습니다. 그러나 초기 평가에서는 보수적인 위험 임계값 설정을 권장하며, 위험 수준이 우려되는 경우 추가 평가를 위해 활동을 일시 중지할 것을 제안합니다.
METR은 모델의 능력을 효과적으로 평가하기 위한 지침을 제시한다. 이 지침은 모델이 훈련 후 향상된 정도를 고려한 능력 측정을 목표로 하며, 특히 자율 능력 평가에 초점을 맞추고 있다. 주요 목표는 모델의 실제 접근 가능한 능력을 정확하게 측정하여 위험 수준을 정확히 평가하는 것이다. 평가 과정은 기본적인 향상 기법을 적용한 후, 남은 실패 모드를 분석하고 그에 따라 다르게 처리하는 방식으로 진행된다. 평가자는 실패 보고서를 작성하고 평가의 유효성을 보증해야 한다. 지침은 실험적 검증 없이 추론에 기반한 제안이며, 추가 연구가 필요하다.
본 연구는 포스트 트레이닝 향상이 에이전트 성능에 미치는 영향을 측정한다. OpenAI의 GPT-4 모델을 기반으로 한 에이전트들의 성능을 평가한 결과, OpenAI의 포스트 트레이닝은 에이전트 성능을 26% 향상시켰으며, 이는 GPT-3.5 Turbo에서 GPT-4로 업그레이드한 효과와 유사하다. 추가적인 에이전트 개선 노력은 통계적으로 유의미하지 않은 8%의 향상만 보였다. 이는 에이전트가 이미 효과적인 훈련을 받았다면 그 능력을 극적으로 높이는 것이 쉽지 않다는 초기 징후를 보여준다. 그러나 연구 결과는 아직 결론을 내리기에 충분하지 않으며, 더 많은 여지가 남아 있다고 예상된다.