🇬🇧 Inoculation Prompting 제안: 학습 중 ‘원치 않는 특성’을 의도적으로 끌어내는 지시를 데이터에 추가하면 시험 시 그 특성이 크게 억제됨(2025.10.05)
학습 데이터에 짧은 system-prompt를 선행해 원치 않는 trait를 의도적으로 eliciting하도록 만든 뒤, 시험 시에는 그 지시를 제거하는 방식(inoculation prompting)을 제안했다. 해당 방식의 모델은 수정하지 않은 데이터로 학습한 모델보다 시험 시 원치 않는 trait 발현이 더 낮았으며, 장난감 예시에서는 ALL-CAPS/스페인어 조건을 부분적으로 학습시키는 등 선택적 효과도 보고했다. 추가로 task-specific finetuning의 emergent misalignment(EM) 감소, backdoor injections 방어, subliminal learning을 통한 trait 전파 완화에도 유효하다고 설명하며, trait의 ‘덜 놀라운(surprising)’ 상태를 만들어 전역 업데이트의 최적화 압력을 줄여 generalization 정도를 낮추는 메커니즘을 제시했다.