🇬🇧 대규모 언어모델 unlearning 평가 결과가 결정적이지 않음(2025.05.31)
기존 unlearning 평가는 기밀/원치 않는 데이터를 모델에서 제거하는 능력을 검증하지만, 최근 연구들은 제거 지식이 쉽게 회복될 수 있다고 지적돼 왔다. 해당 글은 평가 과정에서 테스트 중 모델이 재학습되며(정보 주입) 실제 unlearning 성능을 가릴 수 있고, 태스크별 결과가 크게 달라 현 평가 루틴의 일반화가 어렵다고 본다. 또한 다수 평가는 우연적 상관관계에 의존해 결과 해석과 신뢰성이 떨어질 수 있어, 현재 프로토콜이 unlearning 성공을 과대·과소 모두 반영할 수 있다고 결론내린다. 이를 보완하기 위해 ‘minimal information injection’과 ‘downstream task awareness’를 원칙으로 제시하고 실험으로 검증했다.