AI 안전 다이제스트

2022-07-11 · 1건

🇺🇸 언어 모델 대부분 자신이 아는 것을 안다 (2022.7.11)

기업 · Anthropic-Research · 🚀

Anthropic 연구팀은 언어 모델이 자신의 주장의 타당성을 평가하고 어떤 질문에 정확히 답할 수 있는지 예측할 수 있는지 조사했습니다. 연구 결과, 적절한 형식으로 제공된 다양한 선택 문제와 참/거짓 질문에 대해 더 큰 모델들이 잘 조정된 성능을 보였습니다. 이를 바탕으로 개방형 샘플링 작업에서의 자가 평가를 모델이 먼저 답변을 제안한 후 그 답변의 정확성 확률 "P(True)"를 평가하도록 접근했습니다. 다양한 작업에서 긍정적인 성능, 조정, 확장성을 확인했습니다. 모델이 자신의 여러 샘플을 고려할 때 자가 평가 성능이 더욱 향상되었습니다. 또한, 모델이 특정 답변 없이 "P(IK)", 즉 질문에 대한 답을 알 확률을 예측하는 훈련 방법을 조사했습니다. 모델은 P(IK) 예측에서 좋은 성과를 보였으며, 일부 작업 간 일반화 능력도 보였지만 새로운 작업에서의 조정에는 어려움을 겪었습니다. 맥락 내 관련 자료의 존재와 수학 문제의 힌트가 있을 때 P(IK) 예측 확률이 적절히 증가하는 경향도 확인했습니다. 이러한 관찰은 더 정직한 모델 훈련과 다른 인간 글쓰기 모방 외의 목표로 훈련된 모델의 정직성이 어떻게 일반화되는지 조사하는 기반이 되기를 기대합니다.