🇬🇧 Breaking agent backbones: Evaluating the security of backbone LLMs in AI agents (2025.10.26)
LLM 기반 AI 에이전트가 대규모로 배치되는 가운데, 백본 LLM 선택이 에이전트 보안에 미치는 영향을 체계적으로 다루기 어렵다는 문제를 제기한다. 이를 위해 에이전트 실행 흐름의 특정 상태에서 LLM 취약점이 드러나는 구간을 분리해 위협을 정리하는 “threat snapshots” 프레임워크를 제안하고, 이를 바탕으로 194,331개의 크라우드소싱 공격으로 구성된 b³ 벤치마크를 구축했다고 설명한다. 31개 인기 LLM을 평가한 결과, 추론 능력이 향상될수록 보안이 개선되는 경향이 있으나 모델 크기는 보안과 상관관계가 없다고 밝혔다. 또한 벤치마크·데이터셋·평가 코드를 공개해 에이전트 개발자와 모델 개발자 모두가 백본 보안 개선을 우선하도록 돕겠다고 한다.