AI 안전 다이제스트

2026-04-26 · 3건

🇺🇸 오픈AI, 지역사회 안전 노력 공지 (2026.4.26)

K-AISI 주간동향 · OpenAI · 🧒🚀

OpenAI는 사용자가 ChatGPT를 이용해 현실 세계의 폭력이나 범죄를 모의하는 것을 차단하기 위해 유해 콘텐츠 감지 시스템을 고도화하는 등의 안전 조치를 공지. 자동화 시스템과 인간의 문맥 평가를 병행해 위험 신호를 감지 및 계정을 즉시 차단하며, 임박한 폭력 위험 판단 시 사법 당국 통보와 청소년 자녀 보호 기능 등을 운영.

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms (저자 외 8명, HuggingFace Daily Papers, 2026.4.26)

연구 · HuggingFace-Papers · 📏

VLA(비전-언어-행동) 모델이 체화된(embodied) 지능의 공통 기반으로 확산되면서, 물리적으로 되돌릴 수 없는 결과, 비전·언어·상태 전반에 걸친 멀티모달 공격면, 실시간 지연 제약 하의 방어, 장기 궤적에서의 오류 전파, 데이터 공급망 취약성 등 새로운 안전 문제가 부각된다. 본 연구는 기존에 로봇 학습/적대적 ML/정렬/자율시스템 안전으로 분산된 문헌을 통합해, 위협을 “공격 타이밍(학습 vs 추론)”과 “방어 타이밍(학습 vs 추론)”의 두 축으로 정리하고 Attacks-Defenses-Evaluation-Deployment의 네 관점으로 체계화한다. 평가 측면에서는 학습 시점 위협(데이터 포이즈닝, 백도어)과 추론 시점 공격(적대 패치, 크로스모달 섭동, 시맨틱 재일브레이크, 프리징 공격)을 검토하고, 기존 벤치마크/지표를 정리하며 도메인별 안전 과제를 논의한다. 한계로는 체화 궤적에 대한 인증(certified) 강건성, 물리적으로 실현 가능한 방어, 안전 인지 학습, 통합 런타임 안전 아키텍처, 표준화된 평가의 부재가 핵심 오픈 문제로 제시된다. 정책·규제 및 국가 전략 측면에서는 로봇/자율시스템의 멀티모달·실시간 특성을 반영한 안전 평가 표준과, 데이터 공급망 및 배포 전 검증 체계(벤치마크/지표 표준화 포함) 마련의 필요성이 시사된다.