측정된 체인 오브 생각 추론의 충실도 (2023.7.18)
대형 언어 모델(LLMs)이 질문에 답하기 전에 단계별 추론 과정을 제시함으로써 성능이 향상되지만, 제시된 추론 과정이 모델의 실제 추론 과정을 정확하게 반영하는지는 불분명하다. 본 연구에서는 모델 예측이 체인 오브 생각(CoT) 추론 과정에 개입되었을 때 어떻게 변하는지 분석하여 CoT 추론의 충실도를 평가한다. 모델 간 성능 차이와 CoT의 영향력이 다양하게 나타나며, 모델 크기와 작업 유형에 따라 CoT의 충실도가 달라진다. 결과적으로, CoT의 성능 향상은 단순히 추가적인 계산량이나 특정 표현 방식에 의존하지 않으며, 모델이 커짐에 따라 대부분의 작업에서 CoT의 충실도가 감소하는 경향이 있다. 따라서 CoT의 충실도는 모델 크기와 작업 유형을 신중하게 선택함으로써 유지될 수 있다.