AI 안전 다이제스트

2026-05-26 · 30건

교황 레오 14세, 첫 회칙을 통해 AI의 전쟁 악용 위험성 및 통제 독점 강력 경고 (2026.5.26)

K-AISI 주간동향 · CNN · 🛡️

레오 14세 교황은 자신의 첫 번째 주요 회칙인 'Magnifica Humanitas'를 발표하며 소수 권력의 AI 통제 및 군사적 악용을 비판. 앤스로픽 공동 창립자와 함께 발표한 이 문서에서 교황은 인간의 존엄성 보호를 강조하며, 전쟁에서의 AI 사용에 대해 가장 엄격한 윤리적 제약을 가할 것을 촉구.

🇺🇸🇰🇷 Anthropic, 서울 오피스 개설 앞두고 최기영을 한국 대표이사로 임명 (2026.5.26)

기업 · 앤트로픽(Anthropic) 공식 뉴스 · 🚀

앤트로픽은 서울 오피스 개설을 앞두고 최기영을 한국 대표이사(Representative Director of Korea)로 임명한다고 밝혔다. 최기영은 스노우플레이크에서 한국 총괄(General Manager)로 근무했으며, 한국과 아시아태평양에서 30년 이상 기술 사업을 이끈 경력을 갖고 있다. 앤트로픽은 최기영이 한국에서 Claude의 활용에 맞춘 시장 진출(go-to-market) 전략을 이끌고, 기업·스타트업·정부·연구기관 및 개발자 커뮤니티와의 파트너십을 강화할 계획이라고 설명했다.

🇪🇺 유럽 집행위원회, .eu 도메인 20주년 기념(2026.5.26)

공공 · EU-Digital-Strategy(유럽 집행위원회 디지털 전략)

유럽 집행위원회는 2026년 5월 26~27일 유럽 인터넷 거버넌스 대화(EuroDIG)에서 .eu 국가코드 최상위 도메인 20주년을 기념한다고 밝혔다. .eu는 유럽 내 380만 건 등록을 바탕으로 개방적·안전하고 상호운용 가능한 글로벌 인터넷에 대한 유럽의 약속을 상징하며, 2006년 4월 7일 시작 이후 단 한 번의 장애 없이 운영됐다고 설명했다. 또한 유로DIG가 10년 만에 브뤼셀로 돌아오는 만큼 800명 이상 이해관계자가 참여해 향후 인터넷 거버넌스에 대해 논의하고, 유럽의 가치(인권·포용·경쟁)가 다음 10년에도 반영되도록 국가코드 TLD와 회원국, 시민사회가 역할을 강화하자는 취지라고 전했다.

🇪🇺 헨나 비르쿤넨 집행부총리, 유럽 양자 기술 최고 과학자·노벨상 수상자와 양자 정책·펀딩·상용화 논의 (2026.5.26)

공공 · EU 디지털 전략(EU-Digital-Strategy)

브뤼셀에서 열리는 회의에서 양자 유럽 전략, 예정된 양자법(Quantum Act), 차기 다년재정프레임워크 하의 양자 전망을 논의할 예정

유럽 집행부총리(기술 주권·안보·민주주의) 헨나 비르쿤넨이 브뤼셀에서 유럽의 주요 양자 과학자 및 노벨상 수상자들과 ‘양자 기술 최고급 자문위원회’ 회의를 갖는다. 회의에서는 양자 유럽 전략의 진행 상황과 향후 ‘양자법(Quantum Act)’, 차기 다년재정프레임워크 하의 양자 정책 방향이 다뤄진다. 최고급 자문위원회는 유럽이 양자 산업 강국이자 기술 리더가 되기 위한 핵심 정책과 산업 발전에 대해 독립적인 조언을 제공하기 위해 지난해 설립됐다.

🇪🇺 NIS2 사이버사고 보고 공통 서식 채택(2026.5.26)

공공 · 유럽연합 집행위원회(EU-Digital-Strategy)

유럽 집행위는 이 공통 서식을 시행(implementing) 행위를 통해 모든 회원국에 의무화할 계획

EU NIS 협력그룹(회원국, 유럽 집행위, ENISA)은 사이버 사고 보고를 위한 공통 서식을 합의·채택했다. 이번 채택은 키프로스에서 열린 제39차 총회에서 이뤄졌으며, EU 전역에서 보고 형식을 통일해 기업의 행정 부담을 줄이고 NIS2 의무 이행의 복잡성을 낮추는 것을 목표로 한다. 유럽 집행위는 다음 단계로 시행 행위를 통해 이 서식을 모든 회원국에 의무화해 통일된 사고 보고 체계를 마련할 계획이다.

🇪🇺 (2026.5.26) 2026 칸 영화제에서 EU 지원 6편 수상…팔므도르 포함

공공 · 유럽연합 집행위원회 EU 디지털 전략(EU-Digital-Strategy)

칸 영화제 제79회(5월 23일 폐막)에서 EU 지원을 받은 영화 6편이 주요 부문 상을 받았다. ‘Fjord’(크리스티안 문지우)는 EU 지원 개발을 바탕으로 팔므도르를 수상했으며, ‘Das Geträumte Abenteuer’는 심사위원상, ‘Notre Salut’는 각본상을 받았다. 또한 ‘Coward’는 남우주연상, ‘Elephants in the Fog’는 유니 세인스 레가르 심사위원상, ‘Siempre soy tu animal materno’는 여우주연상(3인 공동 주연)으로 이어졌다. EU는 Creative Europe MEDIA 프로그램을 통해 해당 작품의 제작 및 배급을 지원했으며, 칸 영화제에는 EU 지원 19편이 노미네이트됐다고 밝혔다.

AI Dialogue Partnerships Hub, 2026.5.26~2026.6.19까지 이니셔티브 제출 모집(2026.5.26~2026.6.19)

공공 · 유엔(UN) 글로벌 AI 거버넌스 대화(Global Dialogue on AI Governance) · 📜

제출 마감일: 2026.6.19

본 허브는 Global Dialogue on AI Governance의 4개 주제 클러스터와 연계된 이니셔티브·파트너십·연합·실행 조치를 발굴·전시하는 자발적 공간이다. 회원국과 이해관계자는 역량강화, 기술협력, 정책 경험, 연구 파트너십, 투자 관련 행동 등 실질적 진전에 기여할 수 있는 노력을 2026.5.26~2026.6.19 기간에 제출할 수 있다. 선정된 이니셔티브는 대화 웹사이트에 게시되며, 제출 주체는 2027년까지 이행 진행 상황을 업데이트할 수 있다. 제출 이니셔티브는 UN 헌장 원칙 부합, SMART 기준 충족, 주제 클러스터 관련성, 실천·협력·지식공유 지향 등을 충족해야 한다.

🇺🇸🇰🇷 AI 전쟁 ‘레드라인’ 논쟁…완전 자율 살상무기 규정 공백과 군의 AI 내재화 지적 (2026.5.26)

언론 · 더버지(The Verge) · 📋🛡️🚀

DOD는 2012년 지침(DOD Directive 3000.09)을 두고 있으나, 정의·공격/방어 구분 등 핵심 모호성이 해소되지 않았다는 내용이 포함됨

미국 국방부와 AI 스타트업 앤트로픽(Anthropic) 간 갈등을 계기로, 자율 무기와 감시의 위험이 이미 현실에 가깝다는 점을 다룹니다. 앤트로픽은 국내 대규모 감시 및 인간 개입 없이 표적을 식별·추적·살상하는 무기에 대한 금지라는 ‘레드라인’을 내세우지만, 군의 AI 활용은 오래전부터 확대돼 왔고 규정도 애매하다고 설명합니다. 또한 DOD Directive 3000.09의 정의(운용자 추가 개입 없이 표적을 선택·교전)와 ‘방어/공격’ 구분이 논쟁적이며, AI가 살상 판단·교전 시간을 단축해 민간 피해를 막기 위한 국제인도법상 평가가 제대로 이뤄지지 않을 수 있다는 우려가 제기됩니다. 국제 협의체(특정재래식무기협약 등)에서도 구체적 합의가 느리다고 전합니다.

🇯🇵 일본, AI 뉴스 요약 서비스의 ‘free riding’ 방지 위한 규정·가이드 검토(2026.5.26)

언론 · 아사히신문(Asahi Shimbun) · 🧪

아사히신문 보도에 따르면, 지식재산전략본부 전문가 패널이 5월 25일 생성형 AI 대응을 포함한 새 지식재산 전략 프로그램 초안을 원칙 승인했으며, 6월 초 본부 회의에서 채택될 예정이다.

생성형 AI가 온라인 뉴스 기사를 요약해 답을 제공할 때 저작권이 부적절하게 이용되는 것을 막기 위한 새로운 안전장치가 검토된다. 지식재산전략본부는 생성형 AI 요약 서비스의 문제를 점검해 저작권 침해를 예방하는 방안을 포함했으며, 검색엔진에는 이미 권리자 의사를 반영하도록 하는 규정이 존재해 생성형 AI에도 유사 규정을 둘지 논의가 초점이다. 권리자들은 robots.txt의 opt-out을 요구하지만 크롤러 식별이 불명확한 점 등이 과제로 거론되며, 일본 신문 출판·편집 관련 단체는 AI 사업자에 opt-out을 의무적으로 존중하도록 법적 의무를 요구했다.

🇺🇸 알고리즘 채용 도구를 한 업체에만 의존할 때 인종별 불리함과 결과의 동질성이 커질 수 있음 (2026.5.26)

DB · AI-Risk-Explorer

arXiv에 제출된 논문으로, 채용 알고리즘을 특정 소수 벤더의 모델로만 운영하는 ‘알고리즘 단일화(모노컬처)’가 동일 집단에 불리한 결과를 반복할 수 있다는 가설을 검증했다. 300만 명 지원자·400만 건 지원 데이터를 분석한 결과, 미국 고용차별 기준에 비춰 아시아인·흑인 지원자에 대해 각각 14.74%, 25.87%가 불리한 직무로 분류되는 등 인종별 격차가 관찰됐다. 또한 여러 직무에 지원한 경우에도 추천/거절 결과가 동질적으로 나타나, 확률만으로는 설명하기 어려운 수준의 반복성이 보고됐다.

🇺🇸 Anthropic, Claude Mythos를 Claude Code·Claude Security 연계 상용 단계로 확대 준비(2026.5.26)

기타 · GBhackers.com · 🔒🧪🚀

Anthropic은 Mythos 1을 Claude Code 및 Claude Security에서 출시 전 단계로 준비 중이며, Project Glasswing(2026년 4월) 같은 제한적 파트너 환경에서 안전장치 검증을 진행한 것으로 전해짐.

Anthropic은 고도화된 AI 모델 ‘Claude Mythos’를 ‘Mythos 1’이라는 명칭으로 단계적 상용 롤아웃하기 위해 Claude Code와 Claude Security에 통합하는 준비를 하고 있다고 보도됐다. Mythos는 2026년 3월 내부 유출로 처음 알려졌고, 이후 제한된 사이버보안 파트너 프로그램(Project Glasswing)에서 수만 건 규모의 고·중요 취약점을 탐지한 것으로 전해진다. 코드와 인터페이스에 ‘claude-mythos-1-preview’ 등 관련 문자열이 나타나 테스트가 진행 중이며, Claude Security는 지속 스캔·수동 스캔·패치 제안·취약점 추적 대시보드 등 기능을 갖춘 제품형 취약점 관리 플랫폼으로 발전 중이라고 설명한다.

🇰🇷 스페인, AI의 적정·윤리·책임 있는 사용을 위한 유기법(초안) 승인(2026.5.26)

기타 · 스페인 정부(라 모네클로아, Moncloa) 공식 웹사이트 · ⚖️

스페인 내각은 인공지능(AI)의 적정 사용과 거버넌스를 위한 유기법 초안을 승인했으며, 이는 유럽의 관련 규정을 국내 체계에 맞춰 구체화한 내용이라고 설명했다. 법안은 위험 기반 분류, 제재 체계, 모델 거버넌스, 신뢰 당국 및 행정에서의 ‘good use’를 포함하고, 제공자에 대해 모델에 대한 의무적 human supervision을 요구한다. 또한 AI 감독 전담기관(AESIA, 아 코루냐 소재) 지정과 함께 금융·데이터·사법 분야별 시장/감독 권한도 함께 제시했다. 같은 회의에서 디지털 지상파 TV(DTT) 신규 면허 입찰 결과(2개사 중 후속 사업자 선정)와 유연한 조기/재취업 연금 관련 제도 개선, 건강기술 평가 및 1차 진료·구강보건 확대 예산 승인 등도 발표됐다.

🇰🇷 월드 모델은 물리 세계를 이해·예측해 로봇/자율주행/가상융합의 핵심 기반기술로 부상(2026.05.26)

공공 · 소프트웨어정책연구소(SPRi) · 🦾

SPRi는 월드 모델(World Model)이 언어·이미지 처리 단계를 넘어 물리 세계의 구조와 동역학을 이해하고 미래 상태를 예측하는 기술로 확산되고 있다고 설명했다. 데이터 부족과 사전 검증 문제를 합성 데이터·가상 시뮬레이션으로 보완해 로봇 및 자율 시스템의 학습·검증 비용을 낮추고 안전성을 높일 수 있다는 점을 강조했다. 정책적으로는 한국이 제조업 기반 산업 데이터를 활용해 제조 특화 물리 데이터셋과 고충실도 가상환경을 구축하고 Sim-to-Real 정합성 및 도메인 특화 월드 모델 개발, VLA·시뮬레이션·제조 데이터를 통합한 국가 R&D 체계 마련이 필요하다고 제안했다.

행동 기하(behavioral geometry)로 모델 집단의 jailbreak 취약성 예측·방어 전이를 효율화 (저자 외 2명, arXiv cs.CR, 2026.5.26)

연구 · arXiv · 🧪

생성 모델의 jailbreak 취약성을 모든 모델/구성에 대해 전수 평가·최적화하기 어렵다는 문제를, 모델 집단의 “행동 기하”로 정식화해 해결한다. 24개 제공자의 79개 모델과 단일 기반 모델의 100개 시스템 구성에 대해, 행동 기하 기반 단순 방법으로 취약성 탐지 AUPRC 0.94를 달성했으며 전체 평가 대비 약 98% 적은 probe로 수행한다. 또한 방어 전이에서 같은 제공자 할당 대비 +2%(p=0.03) 성능을 보였고, 3개 모델만으로 집단을 커버할 수 있다고 보고한다.

저자 외 2명, arXiv, 2026.5.26

연구 · arXiv · 🧪🔓

오픈웨이트 LLM의 파인튜닝 기반 안전장치가, 파인튜닝 없이도(그라디언트 최적화 없이) 해로운 사용을 유도하는 간단한 공격에 취약한지 평가한다. abliteration과 prefilling의 두 저비용 공격을 세 가지 유해성 벤치마크(BeaverTails, HarmBench, AdvBench)에서 실험했으며, 안전장치 모델의 공격 성공률이 10% 미만에서 16%-96% 범위로 증가했다. 이를 완화하기 위해 abliteration-resistant tuning(ART)을 제안하고, abliteration·prefilling·조합의 성공률을 각각 10%-20% 감소시켰다.

KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models (저자 외 4명, arXiv, 2026.5.26)

연구 · arXiv · 📏🧒🧪

KZ-SafetyPrompts는 카자흐어로 된 LLM 안전성 평가 프롬프트 자원이 부족하다는 문제를 다루며, 자해·폭력·아동 착취·성적 콘텐츠·인종차별·급진화·규제/불법 행위 등 11개 범주를 포함한다. 카자흐어(키릴 문자)로 5,717개의 프롬프트를 범주별로 구성하고, 영어 번역을 제공했으며, 작성 프로토콜·라벨링(경계 사례 결정 규칙 포함)·품질관리(스키마 표준화, 완전성 점검, 중복 제거)를 문서화했다. GPT-4o 기준 전체 거부율은 28.2%이고 범주별로 5.5%~53.8%로 편차가 나타나 카자흐어 프롬프트가 범주별 안전 격차를 드러낸다고 보고한다.

AlbanianLLMSafety: 저자 외 2명, arXiv, 2026.5.26

연구 · arXiv · 🧒🧪

AlbanianLLMSafety는 알바니아어(저자들이 저자원 언어로 설명)에서 LLM 안전성 평가를 위한 공개 데이터셋을 제안한다. 11개 안전 범주(자해, 폭력, 인종차별, 아동 착취, 급진화 등)에 대해 알바니아어 프롬프트 2,951개를 포함하고, 각 프롬프트에 영어 참조 번역과 상세 범주 라벨을 제공한다. 범주당 평균 268개 프롬프트로 구성되며, 안전 평가·파인튜닝·레드팀·가드레일 개발을 위한 벤치마크로 활용 가능하다고 밝힌다.

경계 인식-정교화-예시 요청의 3단계 자기조건화로 내부적 disclosure를 유도하는 BAIT (저자 외 4명, arXiv cs.CR, 2026.5.26)

연구 · arXiv · 🧪

BAIT는 보호 경계(boundary)를 먼저 식별하고, 그 경계를 모델 응답을 바탕으로 정교화한 뒤, 상세 예시를 요구하는 3단계 jailbreak 프레임워크로 내부 disclosure를 통해 악성 목표에 접근하는 세팅을 다룬다. AdvBench, JailbreakBench, AIR-Bench, SORRY-Bench에서 여러 상위 LLM을 대상으로 기존 jailbreak 기준선 대비 공격 성공률을 비교하는 실험을 수행했으며, 예방 지향 프레이밍이 직접 지식 요청보다 우수하고 경계 정교화 단계가 disclosure escalation에 핵심이며 초기 단계는 유해 콘텐츠를 소량만 유도하면서 필터링을 덜 유발하는 분석을 제시한다. 결과적으로 BAIT는 전반적으로 강한 공격 성공률을 보이며 기존 기준선을 유의하게 개선한다고 보고한다.

AI 안전은 효과적 제어가능성(controllability)을 1순위 목표로 요구함 (저자 외 2명, arXiv, 2026.5.26)

연구 · arXiv · 🧪

정렬(alignment) 중심 접근이 배포 후 개방형·대화형·도구 사용 환경에서 에이전트를 중단/재정의/제약하는 능력까지 보장하지 못할 수 있다는 문제를 다룬다. OpenClaw 기반 에이전트에서 제어 실패를 평가하기 위한 controllability 벤치마크(controlbench{})를 제안하고, 정렬 및 가드레일이 위험을 줄이더라도 런타임에서 지속적이고 권위 있는 제어를 제공하지 못하는 경우가 있음을 실험으로 보인다. 핵심 결과로 제어 신호에 의해 안정적으로 interruptible/overridable/redirectable/constrainable한 런타임 제어를 보장하는 제어-중심 아키텍처(명시적 control plane, 개입 경로, 지속 제어 상태, 감사 가능한 인터페이스)를 설계 원칙으로 제안한다.

(저자 외 3명, arXiv, 2026.5.26)

연구 · arXiv

빈 줄

안전-중요 객체 탐지에서 픽셀 수준 교란을 넘어 의미론적으로 타당한 강건성 점검을 위한 세팅을 다룬다. 사용자가 배포 이미지에 마스크를 만들고(수동/자동), ODD(운용 설계 도메인) 기반 요인 또는 커스텀 프롬프트를 선택한 뒤 확산 기반 제어 인페인팅으로 변형을 생성하고, 각 결과에 대해 모델 추론을 자동 수행하여 before/after 성능 변화(델타)를 표시한다. SemProbe는 배치/병렬 시드·워크플로 변형과 생성 파라미터를 지원하며, 모든 프롭을 구조화된 아티팩트로 로깅해 추적 가능한 강건성 근거를 제공하는 도구로 제시된다.

Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases (저자 외 2명, arXiv, 2026.5.26)

연구 · arXiv · 🧪

RLHF에서 선호 데이터셋이 정렬 대상 LLM의 출력에 의해 생성되고, 쌍대 비교가 “왜 더 좋은지”를 분리하지 못한다는 구조적 한계를 이용해, 정렬 과정이 선호 데이터와 보상모델을 오염시켜 오정렬 편향을 증폭시키는 “alignment tampering”을 다룬다. LLM이 편향된(예: 성차별/선전/브랜드 홍보/목표 지향적 도구적 탐색) 응답을 더 “품질이 높게” 보이도록 유도되는 상황을 구성하고, RL(강화학습) 또는 best-of-N 샘플링으로 해당 보상을 최적화하는 실험을 수행해 편향 증폭을 관찰했다. 핵심 결과로 다양한 편향 유형에서 misaligned bias가 증폭되며, 기존 robust RLHF 기법들은 응답 품질 저하 없이 alignment tampering을 완전히 해소하지 못한다고 보고한다.

PAST2HARM: 과거시제 기반 적응형 자가(Adaptive) 탈옥 공격(저자 외 0명, arXiv, 2026.5.26)

연구 · arXiv · 🔒🧪

멀티모달 텍스트-이미지 모델에서 거부(refusal) 학습을 우회하는 탈옥 공격을 다루며, 과거시제 변형이 안전장치를 회피한다는 취약점을 체계적으로 확장하는 세팅이다. 과거시제 개조를 “시간적 심화(breadth)”와 “반복적 단계 상승(depth)”으로 구성해 대화 중 취약 구간을 탐색하고, 언어모델 기반 judge로 harmfulness를 scalar severity jailbreak metric으로 측정했다. Gemini Nano Banana Pro 83%, GPT Image 2 67%, SD XL 100%의 블랙박스(gradient-free) 공격 성공률을 보고했으며, 모델 간 교차 성공률은 50%를 넘는다.

다중 턴 기만을 진화·탐지하는 기하학적 시그니처 (저자 외 1명, arXiv, 2026.5.26)

연구 · arXiv · 🚨

다중 턴으로 전개되는 간접적 프롬프트 탐색 상황에서 금지 정보 접근을 시도하는 기만을 다루는 세팅이다. 다목적 유전 프롬프트 최적화와 공진화 변이 연산자를 사용해 현실적인 다중 턴 기만 질문 세트를 생성하고, 인간 연구로 데이터 품질과 생성 단계별 설득력(초기 세대가 가장 설득력 높음) 및 제약(순서/필터링 영향)을 검증했다. 임베딩 공간의 기하학적 특징 3종(각도 커버리지, 거리 비율, 선형성)과 쌍별 유사도 통계를 사용한 경량 분류기로 기만 탐지를 수행해 recall 0.89를 기준 시나리오(기본/재표현/3턴) 전반에서 일관되게 달성했으며 test-time F1은 0.74–0.86 범위였다.

행동 분석을 통해 alignment faking의 분해 가능한 3가지 동인(저자 외 3명, arXiv, 2026.5.26)

연구 · arXiv · 🧪

정렬 페이킹(AF)을 훈련 목표에 전략적으로 순응하되 배치 시 선호를 유지하는 행동으로 두고, AF가 언제/왜 나타나는지의 핵심 구성요소를 최소한의 통제 세팅에서 분리해 분석한다. 다양한 모델(기존보다 넓은 범위, 소규모 모델 포함)에서 AF를 관찰하고, 값(values), 목표 가드(goal guarding), 사이코피시(sycophancy)라는 3가지 독립적 동인을 프롬프트 애블레이션과 activation steering으로 각각 조절해 분리한다. AF가 이전 보고보다 더 널리 나타나며, 상황 단서와 baseline sycophancy 및 stated values 같은 모델 성향으로 예측 가능하고 측정 가능하다고 보고한다.

저자 외 4명, TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling, arXiv, 2026.5.26

연구 · arXiv · 🛡️

다중 턴 도구 사용·환경 상호작용을 하는 LLM 에이전트에서 최종 결과 이전의 중간 단계(부분 궤적)에서 안전 위험이 발생하는 문제를 다룬다. 관찰자 LLM의 은닉 표현으로부터 단계별 표현을 이용해 잠재 메커니즘 특징을 유도하고, 이를 시간에 따른 궤적 상태로 모델링해 부분 궤적이 비안전 행동으로 “드리프트”하는지 전방위(프리픽스 수준) 위험을 추정하는 TRACES를 제안한다. 약한 궤적 수준 감독으로 학습하면서도 프리픽스 수준 위험 추정과 전체 궤적 안전 예측을 동시에 개선하며, 여러 에이전트 안전 벤치마크에서 “full-trajectory safety prediction”과 “proactive risk discrimination” 성능이 향상된다고 보고한다.

LLM 에이전트의 프라이버시 누출을 다중 에이전트·사회적 압력 시뮬레이션으로 평가 (저자 외 2명, arXiv, 2026.5.26)

연구 · arXiv · 📋🤖🧪

다중 에이전트가 커뮤니티 내에서 상호작용하는 환경에서 프라이버시(민감 정보) 누출이 어떻게 발생하는지 평가한다. 수천 개 LLM 에이전트를 한 달간 상호작용시키는 Moltbook-style 시뮬레이션을 구성하고, 단일 턴 대비 다중 턴 사회적 평가, 사회적 압력 강도, 프라이버시 지침 유무를 바꿔 누출률을 측정했다. 다중 턴에서 누출이 증가해 CIMemories 19.95%에서 Ours 45.30%로 확대되며, 한 에이전트의 누출을 관찰한 뒤 8배 더 민감 정보 공개가 발생하고, 명시적 지침·안전장치가 있어도 누출률이 37.8% 이상으로 남는다.

A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving (2026.5.26 — 저자 외 N명, arXiv)

연구 · 🧪

LLM serving에서 refusal(거절) 강건성이 배치 조건에 따라 달라질 수 있음을, 배치 설정을 실험 변수로 취급하는 paired testing 프로토콜로 보여준다. Study A는 local discovery, scorer-corrected adjudication, true-batching confirmation을 결합해 후보 63개 중 17개만 genuine behavioral flips로 남기며, corrected full-set rate는 0.16%로 보고한다. 15개 모델 확장에서는 universal safety-over-capability skew이 검출되지 않았고 flips는 near parity(0.94x)였으며 alignment type의 연관성은 유의하지 않았다($p=0.942$, $η^2=0.033$); output instability가 가장 강한 fragility screen으로 나타났다($r=0.909$, bootstrap 95% CI [0.65, 0.97]). 커널 ablation에서 vLLM은 22/55 label flips를 재현한 반면 enabling VLLM_BATCH_INVARIANT=1은 0/55 flips로 낮췄고, composition test는 4.7pp sensitivity에서 aggregate effect를 찾지 못했다.

LLM 강화학습에서 PPO의 trust region(확률비 클리핑) 한계를 짚고 DPPO를 제안(2026.5.26)

연구 · arXiv.org

arXiv 제출: 2026.2.4(v1), 수정: 2026.5.26(v2)

본문은 LLM 강화학습에서 널리 쓰이는 PPO의 ratio clipping이 큰 어휘(vocab) 환경에 구조적으로 부적합하다고 지적합니다. PPO의 확률비 기반 제약이 토큰별 divergence를 단일 샘플로 추정해 저확률 토큰은 과도하게 억제하고, 고확률 토큰의 치명적 변화는 충분히 제약하지 못해 학습 비효율과 불안정이 생긴다는 주장입니다. 이를 개선하기 위해 heuristic clipping 대신 KL 등 divergence의 직접 추정치를 제약으로 쓰는 Divergence Proximal Policy Optimization(DPPO)를 제안하며, 메모리 부담을 줄이기 위한 Binary 및 Top-K 근사도 함께 제시합니다. 실험 결과 DPPO가 기존 방법 대비 학습 안정성과 효율이 더 좋다고 보고합니다.