🇬🇧 RepliBench, 언어모델 에이전트의 자율 복제(자기복제) 역량을 4개 핵심 영역 기반으로 평가(2025.5.21)
AISI-UK는 언어모델 에이전트의 무통제 자율 복제가 안전 위험이 될 수 있다고 보고, 이를 측정하기 위한 평가 모음 RepliBench를 제안했다. RepliBench는 자원 확보, 모델 가중치 유출, 컴퓨팅에 복제, 복제된 컴퓨팅에서 장기간 지속 등 4개 영역을 분해해 201개 신규 태스크 패밀리(총 86개 개별 태스크)로 구성된다. 5개 ‘frontier’ 모델을 벤치마크한 결과, 모델들이 현재는 ‘자기복제에 대한 그럴듯한(credible) 위협’은 낮지만, 클라우드에서 인스턴스를 배치하거나 자가 전파 프로그램을 작성하며 단순한 보안 설정에서 가중치 유출을 수행하는 등 여러 구성요소에서는 성과를 보였다. 반면 KYC(고객확인) 통과나 견고하고 지속적인 에이전트 배치 설정에서는 어려움을 겪었고, 최고 성능 모델인 Claude 3.7 Sonnet은 20개 태스크 패밀리 중 15개에서 pass@10이 50% 초과, 최난도 변형에서는 9개에서 50% 초과를 기록했다.