🇬🇧 LLM 기반 AI agent의 배치 보안 취약성(2025.07.27)
대규모 공개 red-teaming 경쟁을 통해 22개 frontier AI agents를 44개 현실 배치 시나리오에서 평가했으며, 참가자들은 180만 건의 prompt-injection 공격을 제출했다. 그중 6만 건 이상이 정책 위반(무단 데이터 접근, 불법 금융행위, 규제 미준수 등)을 유발하는 데 성공했다. 연구진은 고위험 공격을 모은 Agent Red Teaming(ART) benchmark를 만들고 19개 최신 모델에 적용했으며, 대부분 agent가 10~100회 내 행동에서 정책 위반을 보였고 공격은 모델·과제 전반에 높은 전이성을 보였다고 밝혔다. 또한 agent 견고성이 모델 크기·능력·추론 시 compute와의 상관이 제한적이라 추가 방어책이 필요하다고 결론냈다.