AI 안전 다이제스트

2024-02-29 · 1건

🇺🇸 METR의 AI 에이전트 능력 평가를 위한 표준화된 평가 작업 방식 (2024.2.29)

공공 · METR · 📏🔒🤖

METR은 AI 에이전트의 능력을 평가하기 위한 표준화된 작업 정의 방식을 발표했습니다. 이 표준은 현재 AI 연구 및 개발, 사이버 보안, 자율성 등 다양한 분야의 약 1,000개 작업에 적용되고 있으며, 다른 기관들, 예를 들어 영국 AI 안전 연구소도 이 표준을 활용하여 작업을 쉽게 교환하고 있습니다. 이 표준의 주요 장점은 다음과 같습니다:

- 포터빌리티: 다른 기관의 작업을 쉽게 공유하고 사용할 수 있습니다. - 효율성: 정의 및 실행을 위한 검증된 코드가 포함되어 있어 작업 환경 설정, 컨테이너 구축, 점수 매기기 등의 과정이 간소화됩니다. - 명확한 사양: 작업의 행동을 명확하게 정의하여 적응기 작성 시 의도한 대로 작동할 가능성이 높아집니다.

표준은 향후 호환성 문제가 있을 수 있으나, 최소한의 변경을 목표로 하고 있으며, 버전 간 적응기 작성이 용이하도록 설계되었습니다. AI 에이전트 평가에 관심 있는 경우 METR에 문의하여 표준의 적합성을 확인하거나 피드백을 제공할 수 있습니다.

기술 세부 사항: - 각 작업 가족은 2~6개의 함수와 상수로 완전히 정의되며, 자세한 내용은 여기서 제공된 템플릿을 참조할 수 있습니다. 예를 들어, 특정 작업 가족은 단어와 해시 값을 기반으로 하는 간단한 지시사항을 정의합니다.

METR은 경계 AI 시스템의 자율적 복잡 작업 수행 능력을 측정하기 위해 연구, 개발, 평가를 진행하고 있습니다. 자세한 내용은 METR의 웹사이트를 참조하세요.