AI 안전 다이제스트

2025-10-26 · 2건

🇬🇧 Breaking agent backbones: Evaluating the security of backbone LLMs in AI agents (2025.10.26)

공공 · AISI-UK · 🔒🔬🤖

LLM 기반 AI 에이전트가 대규모로 배치되는 가운데, 백본 LLM 선택이 에이전트 보안에 미치는 영향을 체계적으로 다루기 어렵다는 문제를 제기한다. 이를 위해 에이전트 실행 흐름의 특정 상태에서 LLM 취약점이 드러나는 구간을 분리해 위협을 정리하는 “threat snapshots” 프레임워크를 제안하고, 이를 바탕으로 194,331개의 크라우드소싱 공격으로 구성된 b³ 벤치마크를 구축했다고 설명한다. 31개 인기 LLM을 평가한 결과, 추론 능력이 향상될수록 보안이 개선되는 경향이 있으나 모델 크기는 보안과 상관관계가 없다고 밝혔다. 또한 벤치마크·데이터셋·평가 코드를 공개해 에이전트 개발자와 모델 개발자 모두가 백본 보안 개선을 우선하도록 돕겠다고 한다.

🇬🇧 오픈 가중치 AI 모델의 위험관리에서 16가지 핵심 기술 과제를 제시(2025.10.26)

공공 · AISI-UK · 🔬🔓

오픈 가중치(오픈 웨이트) AI 모델은 연구·테스트를 더 개방적으로 수행할 수 있는 장점이 있지만, 가중치가 임의로 수정되고 감독 없이 사용될 수 있으며 확산이 되돌리기 어렵다는 점에서 위험관리의 도전 과제가 다르다고 설명한다. 논문은 학습 데이터·학습 알고리즘·평가·배포·생태계 모니터링 전반에 걸쳐 오픈 웨이트 안전을 위한 16가지 기술적 과제를 제시하고, 가중치 공개뿐 아니라 연구·방법·평가의 개방성이 엄밀한 위험관리 과학을 만드는 데 중요하다고 결론낸다.