AI 안전 다이제스트

2023-08-08 · 2건

🇺🇸 Anthropic 연구: 대형 언어 모델 일반화 연구에서 영향력 함수 활용 (2023.8.8)

기업 · Anthropic-Research · 🚀

대형 언어 모델(LLM)의 일반화 특성을 이해하기 위해 영향력 함수를 활용한 연구가 소개되었다. 연구팀은 EK-FAC(Eigenvalue-corrected Kronecker-Factored Approximate Curvature) 방법을 통해 최대 520억 파라미터를 가진 LLM까지 영향력 함수를 확장하였다. 이를 통해 훈련 예시들이 모델의 행동에 미치는 영향을 분석하고, 일반화 패턴, 추상화 수준의 증가, 수학 및 프로그래밍 능력, 다국어 일반화 능력, 역할 연기 행동 등을 조사하였다. 특히, 핵심 구문 순서 변경 시 영향력이 급격히 감소하는 한계점을 발견하였다. 이 연구는 LLM의 일반화 속성을 연구하는 데 강력한 새로운 도구를 제공한다.

🇺🇸 Anthropic 연구: 모델 훈련 데이터에서 모델 출력 추적

기업 · Anthropic-Research · 🚀

Anthropic의 최신 연구는 대규모 언어 모델의 출력이 훈련 데이터에 어떻게 영향을 받는지 분석한다. 연구팀은 통계학에서 유래한 '영향 함수(Influence Functions)' 기법을 활용해 훈련 데이터 중 모델 출력에 가장 큰 영향을 미치는 예시들을 식별한다. 모델 크기가 증가함에 따라 일반화 패턴이 더욱 추상적인 개념으로 변화하는 경향이 관찰되었다. 예를 들어, 더 큰 모델은 생존 본능과 인간적 감정과 같은 추상적인 주제를 반영하는 훈련 시퀀스에 더 큰 영향을 받는 것으로 나타났다. 이러한 접근법은 모델 내부 작동 원리를 이해하고 AI 시스템을 인간 선호도에 맞추는 방법을 모색하는 데 중요한 통찰력을 제공한다. 또한, 모델 출력이 순수한 메모리 기반이 아닌 더 복잡한 처리 과정을 통해 이루어진다는 증거를 제시한다. 연구는 사전 훈련 모델에 초점을 맞추고 있지만, 향후에는 미세 조정 과정에서도 영향 함수를 적용하여 더 깊은 이해를 도모할 계획이다.