AI 안전 다이제스트

2023-10-04 · 1건

🇺🇸 AI 시스템 평가의 어려움 (2023.10.4)

기업 · Anthropic-Research

앤써픽 연구는 AI 시스템 평가의 복잡성과 어려움을 설명하며, 특히 다음과 같은 평가 방법들의 문제점을 다룹니다:

1. 다중 선택 평가: - MMLU (Measuring Multitask Language Understanding): 널리 사용되지만 모델 훈련 중 질문 노출로 인한 불공정성, 간단한 포맷 변경으로 인한 점수 변동, 일관성 없는 구현, 그리고 일부 질문의 오류 가능성 등이 문제점으로 제기됩니다. - BBQ (Bias Benchmark for Question Answering): 사회적 편향 측정에 초점을 맞추지만, 구현의 어려움, 복잡한 편향 점수 해석, 그리고 평가 결과의 실제 유용성 여부 확인 필요성 등이 있습니다.

2. 제3자 평가 프레임워크: - BIG-bench: 다양한 평가를 제공하지만 설치와 실행의 복잡성, 효율성 부족, 버그 발견 등으로 인해 사용하기 어렵습니다. - HELM (Holistic Evaluation of Language Models): 전문가 선정 평가를 제공하지만 모델 특성에 따른 적합성 문제, 느린 반복 시간, 외부 협력의 어려움 등이 있습니다.

3. 인간 평가: - 크라우드워커 기반 A/B 테스트: 실제 대화 상황을 반영하지만 비용과 시간이 많이 들고, 평가자의 다양성에 따른 결과 변동, 그리고 도움fulness와 무해성 사이의 균형 유지 어려움이 있습니다.

연구는 이러한 평가 방법들의 복잡성과 한계를 강조하며, 효과적인 AI 거버넌스를 위해 더욱 정교하고 신뢰할 수 있는 평가 방법론 개발의 필요성을 제기합니다.