콘스티투셔널 AI: AI 피드백을 통한 무해성 (2022.12.15)
Anthropic은 AI 시스템이 더 발전함에 따라 다른 AI를 감독하는 데 도움을 줄 수 있도록 무해한 AI 어시스턴트를 훈련하는 방법을 연구하고 있습니다. 이 연구에서는 인간의 라벨 없이 무해성을 달성하기 위해 '콘스티투셔널 AI' 방법론을 제시합니다. 이 방법론은 두 단계로 이루어져 있습니다: 첫 번째 단계는 감독 학습과 자가 비평 및 수정을 통한 모델 개선으로 이루어집니다. 두 번째 단계는 강화 학습을 통해 AI의 선호도 모델을 훈련시키는 것입니다. 결과적으로, 인간 판단에 따른 무해한 AI 어시스턴트를 개발할 수 있으며, 이는 해로운 질문에 대해 설명을 통해 대응할 수 있습니다. 이러한 접근법은 인간 라벨의 수를 크게 줄이면서 AI 행동을 더욱 정밀하게 제어할 수 있게 합니다.