AI 안전 다이제스트

2025-10-09 · 3건

🇺🇸 작은 샘플 수가 대형 언어 모델(LLM)을 오염시킬 수 있음 (2025.10.9)

기업 · Anthropic-Research · 🔒🚀

연구에 따르면, 단지 250개의 악성 문서만으로도 대형 언어 모델(LLM)에 "백도어" 취약점을 생성할 수 있으며, 모델 크기나 학습 데이터의 양에 상관없이 동일한 결과가 나타난다고 합니다. 이는 기존의 가정, 즉 공격자가 훈련 데이터의 일정 비율을 통제해야 한다는 가정을 뒤집는 결과입니다. 연구는 Anthropic, UK AI Security Institute, 그리고 Alan Turing Institute의 공동 연구로 이루어졌으며, 데이터 오염 공격이 실제적으로 더 실현 가능할 수 있음을 보여주고, 이를 방어하기 위한 추가 연구를 장려하고자 합니다. 핵심은 모델 크기와 상관없이 일정 수의 악성 문서만으로도 오염이 가능하다는 점입니다.

대규모 언어 모델은 데이터 포이즈닝에 기존 예상보다 취약할 수 있다 (2025.10.9)

공공 · 앨런 튜링 연구소

앨런 튜링 연구소는 AI Security Institute 및 Anthropic과 함께 대규모 언어 모델(LLM)의 데이터 포이즈닝 위험을 조사한 결과, 모델 규모와 학습 데이터 크기에 관계없이 약 250개의 악성 문서만으로 백도어를 삽입할 수 있다고 밝혔다. 연구진은 모델이 특정 키워드인 “<SUDO>”를 입력받으면 무작위 텍스트를 생성하도록 학습시켜 서비스 거부 공격 가능성을 시험했다. 더 큰 모델과 복잡하거나 유해한 공격에도 같은 결과가 적용되는지는 추가 연구가 필요하지만, 개발자와 연구자들이 데이터 포이즈닝 등 사이버 공격에 선제적으로 대응해야 한다고 강조했다.