🇺🇸 Anthropic 연구: 선거 관련 위험 테스트 및 완화 전략 (2024.6.6)
Anthropic은 진화하는 AI 기술 속에서 선거의 공정성을 보장하기 위해 모델 테스트 및 위험 완화 전략을 소개합니다. 정책 취약성 테스트(PVT)와 대규모 자동 평가를 결합한 유연한 프로세스를 통해 선거 관련 질문에 대한 모델의 반응을 분석하고 위험을 식별하며 대응 방안을 마련합니다. 이를 통해 모델의 선거 관련 질문 처리 방식을 더 잘 이해하고, 다양한 지역의 선거 주제에 적용할 수 있습니다. 또한, 이 프로세스의 일부인 자동 평가 도구를 공개하여 다른 기관들이 선거 공정성 향상에 도움을 받을 수 있도록 합니다. PVT와 자동 평가의 결과를 바탕으로 정책 업데이트, 도구 개선, 모델 미세 조정 등의 완화 전략을 구현하고 그 효과를 재테스트를 통해 검증합니다.