AI 안전 다이제스트

2023-12-07 · 1건

🇺🇸 언어 모델 결정의 차별 평가 및 완화 (2023.12.7)

기업 · Anthropic-Research · 📋🚀

Anthropic 연구팀은 언어 모델(LM)이 고위험 사회 결정(예: 자금 지원 또는 주거 자격 결정)에 활용될 때 발생할 수 있는 차별 문제를 평가하고 완화하기 위한 방법론을 제시합니다. 연구팀은 다양한 사회적 상황(70가지 시나리오 포함)에서 잠재적인 프롬프트를 생성하고, 각 프롬프트에 인구 통계 정보를 변화시켜 차별 패턴을 분석했습니다. 이를 통해 Claude 2.0 모델에서 긍정적 및 부정적 차별의 패턴을 확인했습니다. 연구는 신중한 프롬프트 설계를 통해 차별을 크게 줄일 수 있는 방법을 보여주며, 언어 모델의 안전한 적용을 위한 지침을 제공합니다. 연구 결과와 프롬프트 데이터셋은 공개되었습니다.