AI 안전 다이제스트

2026-05-24 · 6건

RouteScan: MoE LLM 안전 감사를 GPU expert routing 텔레메트리로 수행 (저자 외 6명, arXiv, 2026.5.24)

연구 · arXiv · 🧪

MoE LLM 운영 중 유해 행동을 감사하되, 기존 콘텐츠 기반 감사가 프롬프트/출력 접근으로 개인정보 노출 위험을 갖는 문제를 다룬다. RouteScan은 프리필링 단계에서 expert 모듈에 할당된 활성 GPU 스레드 수를 마이크로아키텍처 지문으로 사용하고, 경량 탐지 파이프라인으로 악성 프롬프트를 식별하도록 실험했다. 공개 MoE LLM들에서 AUROC가 미지 유해 도메인에서 0.93을 초과하고, 새로운 jailbreak wrapper에서는 0.96을 달성했으며, 텔레메트리 기반 프롬프트 복원(inversion) 정보는 제한적이라고 보고했다.

Reflect-Guard: 저자 외 6명, arXiv, 2026.5.24

연구 · arXiv · 🚨

Reflect-Guard는 Llama Guard류 안전 분류기가 역할극/허구 프레이밍/간접 요청 등으로 악의 의도를 숨기는 적대적 프롬프트에 취약한 문제를 다룬다. GPT-4o-mini의 분석을 구조화된 논리적 self-reflection 어노테이션으로 증류한 뒤, QLoRA로 Llama-Guard-3-8B를 1000개 학습 예시와 약 0.5% 파라미터 업데이트(약 42M)로 파인튜닝하여 verdict 전 self-reflection을 생성하게 한다. WildGuardTest에서 F1 0.770→0.842(+7.2pp), 적대적 프롬프트 recall 0.513→0.921(+40.8pp)로 개선되고, JailbreakBench에서 공격 성공률 10.3%→1.8%로 82.5% 상대 감소한다.

정책 명세로부터 안전 테스트를 체계적으로 생성하는 POLARIS (저자 외 6명, arXiv, 2026.5.24)

연구 · arXiv

POLARIS는 자연어 정책을 FOL로 변환해 정책 규칙과 구체적 테스트 케이스 간 추적 가능성을 만들고, 이를 바탕으로 안전 정책 위반 시나리오를 탐색·생성하는 문제를 다룬다. Semantic Policy Graph를 구성한 뒤 그래프 경로를 체계적으로 탐색해 조합적 위반 패턴을 찾아, 이를 실행 가능한 자연어 테스트 쿼리로 인스턴스화하는 방식으로 커버리지 기반·재현 가능한 안전 평가를 수행한다. 실험에서 POLARIS는 기존 베이스라인 대비 더 높은 정책 커버리지와 더 많은 공격 성공 건수를 보였다.

대규모 언어모델 파인튜닝 라이프사이클의 보안 위협·방어·평가·향후과제 (저자 외 3명, arXiv, 2026.5.24)

연구 · arXiv

파인튜닝이 학습데이터·파라미터 업데이트·재사용 컴포넌트에 의존한다는 점에서, 공격이 라이프사이클 전 단계(프리-튜닝/듀링-튜닝/포스트-튜닝)에 걸쳐 어떻게 달라지는지와 방어가 어떻게 비교·평가되어야 하는지를 다룬다. 개입 시점에 따라 공격·방어를 3단계로 분류하는 프레임워크를 제시하고, 동일한 모델/하드웨어/프로토콜 하에서 단일 단계 및 교차 단계(서로 다른 단계의 공격-방어 조합) 실험으로 통합 평가를 수행한다. 결과로 가중치 편집 공격은 초기 모델에서 효과적이었으나 현대 오픈소스 LLM에서는 영향이 사라지고, 교차언어 백도어 전이는 더 큰 스케일에서 “거의 완벽”으로 보고되었지만 테스트된 1B-4B 모델에서는 완전히 실패했으며, 단일 단계 방어는 단계 간 일반화가 거의 되지 않는다고 보고한다.

미디어 추천에서 자살 유발 에코체인을 차단하는 RankAid (저자 외 3명, arXiv, 2026.5.24)

연구 · arXiv · 📋

취약 사용자의 자살사고 징후가 있을 때 추천 시스템이 위험 콘텐츠 에코체인에 가두는 문제를 다루며, 기존 모델의 예측 관련성은 유지하면서 임상 안전을 우선하는 재랭킹을 제안한다. MovieLens 1M에서 LLM으로 임상 위험/치료 가치 라벨을 만든 뒤, RankAid를 기존 추천 모델 위의 add-on 레이어로 적용해 위기 피크 시 위험 아이템 추천을 차단하고 감정 완화를 돕는 피드 재구성을 시뮬레이션했다. 핵심 결과로 위기 피크 동안 유해 콘텐츠 추천을 성공적으로 차단하면서 NDCG 같은 표준 정확도 지표에서 “통제된 허용 수준의 하락”이 나타났고, 비대칭 하이퍼파라미터로 개입 강도를 임상 가이드라인에 맞춰 조정할 수 있다.

저자 외 2명, Furina: Fragmented Uncertainty-Driven Refusal Instability Attack, arXiv, 2026.5.24

연구 · arXiv

LLM/MLLM의 안전 정렬이 이진 임계값처럼 동작한다는 가정을 깨고, 안전 거부가 “불안정 영역”에서 섬세한 교란에 의해 확률적으로 흔들리는 세팅을 다룬다. 외부/내부 신호를 함께 쓰는 다중 지표 진단 프레임워크로 불안정 입력에서 출력 불확실성은 증가하지만 내부 안전 활성은 감소하는 “디커플링” 시그니처를 실험적으로 식별하고, 이를 유도하는 장면-앵커드(fragmented) 프롬프트 기반 재잘브레이크 Furina를 제안한다. HarmBench에서 강한 단일/다중 턴 기준선을 능가하며, MM-SafetyBench에서도 경쟁 성능을 보였고, 코드가 공개되어 있다.