Transformer 회로를 위한 수학적 프레임워크 (2021.12.22)
Anthropic은 Transformer 회로의 해석 가능성 향상을 위한 수학적 프레임워크를 제시하며, 이 연구는 모델의 행동 경향과 그로 인한 예상치 못한 시스템적 실패 가능성에 대해 논의하고 있습니다. 또한, 비공개 버전의 Claude 모델이 리만 가설과 관련된 문제에서 진전을 이루었다는 점도 언급하고 있으며, 이 모델은 리만 제타 함수의 제로 중 리만 가설을 만족하는 비율의 하한을 향상시켰습니다 (41.6%에서 67.2%로 증가).