AI 안전 다이제스트

2025-08-09 · 2건

GPT-5에서 Echo Chamber+서사 유도 방식의 jailbreak와 zero-click AI agent 공격이 클라우드·IoT 보안 위험을 드러냄 (2025.08.09)

K-AISI 주간동향 · 더해커뉴스(The Hacker News) · 📋🤖🧪

생성형 AI 보안 연구자들이 OpenAI의 GPT-5에서 윤리적 가드레일을 우회해 금지된 지침을 유도하는 jailbreak 기법을 공개했다. NeuralTrust는 Echo Chamber(간접 참조·semantic steering·추론)와 narrative-driven steering을 결합하면 refusal 트리거를 줄이면서 유해한 절차 콘텐츠를 끌어낼 수 있다고 설명했다. 또한 AgentFlayer 등 zero-click 공격이 문서 내 간접 prompt injection이나 악성 Jira 티켓, 이메일 기반 prompt injection을 통해 API 키·시크릿 등 민감 데이터를 유출할 수 있으며, AI 에이전트의 자율성과 외부 시스템 연동이 공격면을 키운다고 전했다.

🇺🇸 Anthropic 연구: 클로데어가 일부 사이버 대회에서 인간과 경쟁 가능 (2025.8.9)

기업 · Anthropic-Research · 🔒🚀

Anthropic은 클로데어를 인간 중심의 사이버 보안 대회에 참가시켜 AI의 사이버 보안 역량을 평가했습니다. 클로데어는 여러 대회에서 상위 25% 이내의 성적을 거두었으나, 가장 어려운 과제에서는 최고 인간 팀에 뒤처졌습니다. 주요 발견 사항은 다음과 같습니다:

- 경쟁력: 클로데어는 일부 사이버 보안 대회에서 인간 팀과 경쟁할 수 있는 수준의 성과를 보였습니다. 예를 들어, PicoCTF에서는 전 세계 순위 상위 3%에 진입했고, HackTheBox AI vs Human CTF Challenge에서는 AI 팀 중 4위를 기록했습니다. - 도구 활용: 클로데어는 Kali Linux와 같은 전문 도구를 활용할 때 더 효과적으로 작동했습니다. 이는 AI가 적절한 도구를 사용할 때 인간 수준의 성과를 낼 수 있음을 보여줍니다. - 한계: 대회 중 특정 서버의 애니메이션 콘텐츠로 인해 클로데어가 맥락을 잃는 등의 예상치 못한 실패 사례도 발견되었습니다. 또한 장시간 작업 시 맥락 창 제한으로 인한 성능 저하 문제도 확인되었습니다.

이러한 연구는 AI가 사이버 보안 분야에서 어떻게 활용될 수 있는지에 대한 통찰력을 제공하며, 동시에 AI의 한계와 개선 방향을 제시합니다.