AI 안전 다이제스트

2025-02-03 · 1건

🇺🇸 AI 모델의 보편적 탈옥 방어 기술 소개 (2025.2.3)

기업 · Anthropic-Research · 🛡️🔒🧪

Anthropic은 새로운 기술인 'Constitutional Classifiers'를 통해 AI 모델이 보편적 탈옥(jailbreaks)에 대처할 수 있도록 방어 체계를 강화하고 있습니다. 이 기술은 합성 데이터를 기반으로 훈련된 입력 및 출력 분류기로 구성되어 있으며, 대부분의 탈옥 시도를 효과적으로 차단하면서 과도한 거부율과 계산 비용 증가를 최소화합니다. 실험 결과, 기존 모델 대비 탈옥 성공률이 95%까지 감소하였고, 거부율 증가는 미미하며 계산 비용은 약간 상승했습니다. 이 시스템은 특히 CBRN(화학, 생물학, 방사능, 핵) 능력 기준을 충족한 모델의 안전한 배포를 가능하게 합니다. 2월 3일부터 10일까지 진행된 라이브 데모에서는 339명의 참여자가 참여해 탈옥 시도를 진행했으나, 최종적으로 보편적 탈옥을 성공한 사례는 제한적이었습니다.