AI 안전 다이제스트

2024-10-16 · 1건

사전 학습 특징 기반 분류기 개발 (2024.10.16)

기업 · Anthropic Research · 🧪

Anthropic의 해석 가능성 연구팀이 사전 학습 특징을 활용한 분류기 개발에 대한 초기 연구 결과를 발표했습니다. 이 연구는 해당 분야에서 활동하는 연구자들에게 유용할 수 있으며, 아직 완성 단계는 아니지만 동료 간의 아이디어 공유처럼 다루어져야 합니다. 연구는 현재 모델의 행동 패턴과 그로 인한 예상치 못한 시스템적 문제들을 식별하고 이를 완화하기 위한 논의를 시작하려 합니다. 또한, 새로운 연구 버전의 Claude 모델이 리만 가설 관련 문제에서 진전을 이루었다는 내용도 포함되어 있습니다. 이 모델은 리만 제타 함수의 제로 중 리만 가설을 만족하는 비율의 하한을 향상시켰습니다.