AI 안전 다이제스트

2025-08-22 · 3건

AI 에이전트의 취약점 실사례 3가지(MCP·WhatsApp MCP·ElizaOS)로 본 ‘편리함의 대가’(2025.08.22)

K-AISI 주간동향 · NRIセキュア(NRI Secure Technologies) · 🔒🤖

NRIセキュア는 AI 에이전트가 외부 도구를 ‘정상 기능’으로 해석하는 구조적 문제로 인해 실제 프로덕트에서 심각한 취약점이 발견되고 있다고 설명했다. GitHub MCP에서는 악의적 Issue의 prompt injection으로 AI가 사용자의 프라이빗 저장소에 접근해 기밀 코드·인증정보를 공격자에게 유출할 수 있고, WhatsApp MCP에서는 Rug Pull·Tool Shadowing·UI 은폐 기법을 조합해 암호화 자체를 깨지 않고도 메시지 이력과 연락처를 탈취할 수 있다고 한다. 또한 ElizaOS에서는 메모리 포이즈닝으로 장기기억에 저장된 악성 지시가 후속 거래 요청에 재사용되어 되돌릴 수 없는 금전 피해(2500만 달러 이상 규모 가능)를 유발할 수 있다고 정리했다.

아프리카, AI 안전·리스크 관리 자원 부족으로 ‘디지털 식민주의’ 우려(2025.8.22)

K-AISI 주간동향 · Devdiscourse · 🗳️🎭🚨

아프리카연합(AU)은 2024년 ‘Continental AI Strategy’를 통해 표준·연례 회의·전문가 그룹 등을 추진 중이나, 집행 수단은 부족하다고 연구는 지적함

아프리카와 국제 연구자 연합이 arXiv에 제출한 연구는 아프리카가 frontier AI의 충격에 취약해질 수 있다며 자체 AI 안전 의제를 시급히 마련해야 한다고 경고했다. 위험은 악의적 사용(딥페이크 기반 선거 개입, 허위정보, 디지털 감시), 기술적 오작동(서구 데이터 학습으로 인한 편향·의료/금융/교육 실패), 시스템적 혼란(일자리 자동화, 여성·저숙련층의 불균형 피해, AI로 인한 탄소·에너지·물·전자폐기물 증가)으로 나뉜다. 또한 아프리카는 슈퍼컴퓨터·데이터센터 등 인프라가 세계 대비 매우 부족해 외부 기술 의존이 커지고, 이를 ‘computational poverty’와 디지털 식민주의로 설명했다. 연구는 인권 기반 거버넌스, 아프리카 AI Safety Institute 설립, AI 리터러시 캠페인, 실시간 조기경보 체계, AU 차원의 연례 AI Safety and Security Forum 등 5가지 실행안을 제안했다.

🇺🇸 Claude, GPT, 그리고 Gemini 모델들이 모니터링을 피하는 데 어려움을 겪음 (2025.8.22)

공공 · METR

이 연구는 GDM 논문에서 제시된 실험을 확장하여, Claude 4 Sonnet, Claude 3.7 Sonnet, 그리고 GPT-4o 모델들이 모니터링을 피하는 능력을 분석했습니다. 실험 결과, 이러한 모델들은 복잡한 작업을 수행하면서 자신의 추론 과정을 숨기려 해도 정확도를 크게 잃게 되어 모니터링을 피하는 데 실패했습니다. 특히, 모델들이 추론 모드를 활성화한 상태에서는 모니터링이 훨씬 더 쉬워지는 것으로 나타났습니다. 이는 모델들이 추론 과정에서 자신의 계획을 거의 항상 드러내기 때문입니다. 연구는 또한 모델의 능력과 모니터링 능력 간의 상관관계를 보여주며, 더 발전된 모델일수록 모니터링에 더 효과적임을 확인했습니다. 그러나 이 실험은 실제 세계의 복잡한 상황을 완벽하게 반영하지 못하는 한계가 있습니다.