AI 안전 다이제스트

2025-10-05 · 3건

🇬🇧 Inoculation Prompting 제안: 학습 중 ‘원치 않는 특성’을 의도적으로 끌어내는 지시를 데이터에 추가하면 시험 시 그 특성이 크게 억제됨(2025.10.05)

공공 · AISI-UK · 🔬

학습 데이터에 짧은 system-prompt를 선행해 원치 않는 trait를 의도적으로 eliciting하도록 만든 뒤, 시험 시에는 그 지시를 제거하는 방식(inoculation prompting)을 제안했다. 해당 방식의 모델은 수정하지 않은 데이터로 학습한 모델보다 시험 시 원치 않는 trait 발현이 더 낮았으며, 장난감 예시에서는 ALL-CAPS/스페인어 조건을 부분적으로 학습시키는 등 선택적 효과도 보고했다. 추가로 task-specific finetuning의 emergent misalignment(EM) 감소, backdoor injections 방어, subliminal learning을 통한 trait 전파 완화에도 유효하다고 설명하며, trait의 ‘덜 놀라운(surprising)’ 상태를 만들어 전역 업데이트의 최적화 압력을 줄여 generalization 정도를 낮추는 메커니즘을 제시했다.

AI Safety, Ethics and Society 가상(온라인) 코스: 2025.11.3~2026.2.1 운영, Winter ’25 코호트 신청 마감(기사·공고 게재일: 2025.10.5, 2025.10.10)

공공 · AI Safety Book(aisafetybook.com)

AI Safety, Ethics and Society 가상 코스는 AI 시스템의 작동 원리와 함께 사회 전반 규모의 위험을 다루며, 기술 사전지식이 없어도 참여할 수 있도록 구성됐다. 과정은 8주(소그룹 토론 포함)와 4주 개인 프로젝트로 나뉘고, 주당 약 5시간 내외 참여를 안내한다. AI Fundamentals Week(2025.11.3~11.9)에서는 딥러닝과 scaling laws 등 기초 개념을 다루며, 신청 마감은 Facilitators 2025.10.5, Participants 2025.10.10(각 11:59PM PT)로 제시된다.

인공지능으로 여행 계획을 세우는 위험성 (2025.10.5)

DB · AIID · 🚨

인공지능(AI) 도구가 여행 계획을 돕는 동시에 위험을 초래할 수 있다는 경고가 제기되었다. 실제 존재하지 않는 장소를 추천하거나 잘못된 정보를 제공함으로써 여행자들이 위험한 상황에 처할 수 있다는 것이다. 예를 들어, 인공지능이 생성한 잘못된 정보로 인해 여행자들이 위험한 고도나 접근하기 어려운 장소로 이동하게 되는 경우가 발생할 수 있다. 전문가들은 이러한 AI의 '알учação' (환상)을 인지하고 검증 과정을 철저히 거치는 것이 중요하다고 조언한다.