AI 안전 다이제스트

2025-05-29 · 1건

🇺🇸 Anthropic 오픈 소스 회로 추적 도구 공개 (2025.5.29)

기업 · Anthropic-Research · 🧪🚀

Anthropic은 최근 해석 가능성 연구의 일환으로 대형 언어 모델의 의사결정 과정을 추적하는 새로운 방법을 개발하고, 이를 오픈 소스로 공개했습니다. 이 도구는 모델의 내부 작동 방식을 부분적으로 드러내는 속성 그래프를 생성합니다. Neuronpedia 플랫폼을 통해 사용자는 상호작용적으로 이러한 그래프를 탐색할 수 있습니다. 이 프로젝트는 Anthropic Fellows 프로그램 참가자들과 Decode Research의 협력으로 이루어졌습니다. 주요 기능은 다음과 같습니다:

- 지원 모델의 회로 추적을 위한 속성 그래프 생성 - 상호작용형 프론트엔드를 통한 그래프 시각화 및 주석 달기 - 모델 출력 변화를 관찰하기 위한 특징 값 수정을 통한 가설 검증

이 도구는 Gemma-2-2b와 Llama-3.2-1b 모델의 다중 단계 추론 및 다국어 표현 등 흥미로운 행동을 연구하는 데 활용되었습니다. CEO Dario Amodei는 해석 가능성 연구의 중요성을 강조하며, 이 오픈 소스 도구를 통해 AI 모델 내부 작동 원리를 더 잘 이해할 수 있도록 커뮤니티에 기여하고자 합니다.

자세한 내용은 코드 저장소와 Neuronpedia 인터페이스를 통해 확인 가능합니다. 문의 사항은 GitHub 이슈 트래커를 통해 제출할 수 있습니다.