AI 안전 다이제스트

2026-05-16 · 8건

교황 레오 14세, 첫 회칙 발표를 앞두고 바티칸 내 'AI 연구 그룹' 신설 (2026.5.16)

K-AISI 주간동향 · WP · 📋🛡️🎭

교황 레오 14세는 AI 기술의 급격한 발전이 인류에 미치는 윤리적 문제를 철저히 분석하고 평화를 촉구하는 새 회칙 발표를 위해 전담 AI 연구 그룹을 창설. AI의 인간 지능 대체, 딥페이크 거짓 정보 및 자동 살상 무기와 같은 AI의 잠재적 파괴성을 경계하는 규제와 윤리 가이드라인을 주도적으로 마련하고자 함.

My Time with Jürgen Habermas, Europe's 'Last Intellectual' (2026.5.16)

언론 · Politico

Politico 매거진 기사로, 유르겐 하버마스(Jürgen Habermas)에 대한 회고/기고 성격의 내용으로 보입니다. 다만 제공된 정보에는 본문이 없어 기사에서 다루는 핵심 주장·사실관계는 확인이 필요합니다. 기사 날짜(2026.3.20)와 CSV 날짜(2026.5.16) 중 어떤 기준을 기사/공고 기준으로 삼아야 하는지 확인이 필요합니다.

“통제 불능이다”: 가짜 AI 증거로 체포될 뻔한 여성의 충격적인 사례 (2026.5.16)

DB · AIID · 🚨

플로리다의 멜리사 심스는 전 남자친구가 인공지능으로 자신이 보낸 것처럼 보이는 문자메시지를 만들어 법원의 접촉 금지 명령을 어겼다는 혐의를 받았고, 이로 인해 24시간 구금됐다. 휴대전화 기록 등이 해당 메시지의 진위를 다투는 데 중요한 역할을 하면서 접촉 금지 명령 위반 혐의는 기각됐고, 별도의 가정폭력 혐의 재판에서도 배심원 전원 무죄 평결이 내려졌다. 이 사건은 경찰과 법원이 스크린샷만으로 디지털 증거를 신뢰하지 말고 통신 기록·메타데이터 등으로 검증해야 한다는 문제를 제기한다.

인공지능 관련 ‘대(對)부처 간 위원회’ 설립 승인(2026.5.16)

기타 · 바티칸(교황청) 프레스 오피스 공식 발표

교황 레오 14세가 2026년 5월 3일자 알현에서 인공지능 관련 대(對)부처 간 위원회(Inter-Dicasterial Commission on Artificial Intelligence) 설립을 승인했다. 이 위원회는 「Praedicate Evangelium」 제28조 5항에 따라 교황청 인간의 완전한 발전을 촉진하는 부처가 주관해 설치되며, 신앙교리성·문화교육부·소통부·생명에 관한 교황청 학술원·과학원·사회과학원 등에서 대표가 참여한다. 위원회 구성 변경은 교황의 승인을 받아야 하고, 조정(코디네이션)은 처음 1년간 인간의 완전한 발전을 촉진하는 부처가 맡은 뒤 교황이 참여 기관 중 한 곳에 1년 단위로 위임한다.

AI-enabled SOAR의 강건성 평가를 위한 자율 레드팀 프레임워크(저자 외 2명, arXiv, 2026.5.16)

연구 · arXiv · 🔒🤖🧪

자율 에이전트를 사용하는 AI-enabled 보안 오케스트레이션/자동화/대응(SOAR) 시스템이 적응형 공격자에 대해 얼마나 견디는지 평가하는 세팅을 다룬다. LLM 기반 플래너(전략적 의도)와 RL 컨트롤러(전술 실행)를 계층적으로 결합하고, 킬체인 진행과 정렬된 reward shaping으로 다단계 공격 캠페인을 생성하는 자율 레드팀 프레임워크를 제안하며 고충실도 엔터프라이즈 시뮬레이션에서 평가한다. 결과로 제안한 하이브리드 LLM-RL 방식이 효과적이었고, 단독 LLM 에이전트는 다단계 공격 캠페인을 지속하지 못했으며 도메인 특화 사이버보안 모델은 제한적인 수준의 컴프로마이즈만 달성했다.

Wide-Net-Casting에서의 실용적 Jailbreak 시나리오와 맞춤 공격(저자 외 3명, arXiv, 2026.5.16)

연구 · arXiv · 🧪

와이드-넷-캐스팅 시나리오에서 공격자가 단일 모델이 아니라 여러 대의 대형 모델을 대상으로 질의해 유해 출력을 유도하는 문제를 다룬다. 해당 시나리오에 맞춘 새로운 jailbreak 방법을 제안하고, 추가 안전장치 없이 모델들을 표적으로 할 때 일부 실험에서 jailbreak 성공률이 100%까지 도달함을 보고한다.

다국어에서 안전 가드레일이 왜 성능 저하되는가(저자 외 3명, arXiv, 2026.5.16)

연구 · arXiv

다국어에서 관측되는 안전 저하를 JSR 같은 단일 지표가 여러 요인을 섞어 원인 분해를 어렵게 만든다는 문제를 다룬다. MultiJail 데이터셋으로 61개 모델 구성(5개 closed-model family, 10개 언어, 190만 행)을 대상으로 Multi-Group IRT(잠재변수 θ, β, γ, τ)로 안전 실패 요인을 분리하고 요인 구조(탐색적 요인분석) 및 예측 성능을 평가했다. 안전은 주로 단일 차원으로 작동하며, IRT는 안전한 거부를 예측하는 AUC=0.940로 단순 기준선을 능가하고, 22개 구성은 저자들이 기대한 “저자원 언어에서 더 취약” 경향과 달리 영어에서 더 취약한 결과를 보였다.