🇺🇸 Anthropic의 다수샷 탈옥 기법 연구 (2024.4.2)
Anthropic은 대형 언어 모델(LLM)의 안전 가드레일을 우회하는 '다수샷 탈옥' 기법을 연구하고 공개했습니다. 이 기법은 LLM의 맥락 창 크기가 급격히 증가함에 따라 효과적이게 되었으며, 특히 256개 이상의 가짜 대화를 포함하는 프롬프트를 통해 모델이 안전 훈련을 무시하고 위험한 응답을 생성하도록 유도합니다. 연구진은 이 취약점을 다른 AI 개발자들과 공유하고, 시스템 내에서 이를 완화하기 위한 조치를 이미 취했습니다. 탈옥 기법의 효과는 맥락 창 크기 증가에 따라 증가하며, 특히 큰 모델에서 더 효과적입니다. 연구진은 프롬프트 기반 완화 기법을 개발 중이며, 이는 모델의 유용성을 유지하면서 탈옥 공격을 줄이는 데 중점을 두고 있습니다. 이 연구는 LLM의 맥락 창 확장이 가져오는 잠재적 위험을 강조하며, 안전 대책 개발의 중요성을 제기합니다.