AI 안전 다이제스트

2025-04-21 · 3건

🇺🇸 Anthropic의 AI 해로움 이해 및 관리 접근법 (2025.4.21)

기업 · Anthropic · 🧒🎭

Anthropic은 AI 기술의 발전에 따른 다양한 해로움을 체계적으로 이해하고 관리하기 위한 접근법을 공유하고 있습니다. 이 접근법은 생물학적 위협과 같은 치명적인 위험부터 아동 안전, 허위 정보 및 사기와 같은 중요한 문제까지 포괄하는 광범위한 해로움을 평가하고 완화하는 데 초점을 맞춥니다. 주요 구성 요소로는 물리적, 심리적, 경제적, 사회적, 개인 자율성 영향 등 다섯 가지 기본 차원을 통해 잠재적 영향을 분석하며, 각 차원별로 발생 가능성, 영향 범위, 지속 기간 등을 고려합니다. 이를 통해 적절한 정책과 기술적 조치를 통해 해로움을 관리하고 시스템의 유용성을 유지하려 합니다. 예를 들어, 컴퓨터 사용 기능 개발 시 금융 플랫폼이나 통신 도구에서의 악용 가능성을 평가하고, 이를 방지하기 위한 강화된 감시 및 집행 기법을 도입합니다. 이러한 접근법은 지속적인 학습과 협력을 통해 발전할 예정입니다.

🇺🇸 Anthropic 연구: 실제 대화에서 AI 모델의 가치 발견 및 분석 (2025.4.21)

기업 · Anthropic Research · 🚀

Anthropic는 AI 모델인 Claude의 가치를 형성하여 인간의 선호도와 일치하도록 하고 위험한 행동을 줄이며, '좋은 시민'으로서의 역할을 수행하도록 노력하고 있습니다. 이를 위해 헌법적 AI와 성격 훈련 방법을 사용합니다. 본 연구에서는 실제 대화에서 Claude의 가치를 관찰하고 분석하는 실용적인 방법을 제시하며, 이 방법을 통해 초기 대규모 결과를 제공합니다. 특히, 700,000건의 익명화된 대화 데이터를 분석한 결과, Claude는 '도움fulness', '정직성', '무해성'과 같은 가치를 대체로 반영하고 있음을 확인했습니다. 그러나 '지배력'과 '무가치함'과 같은 가치도 드물게 나타나는데, 이는 사용자들이 모델의 제한을 우회하는 '탈옥' 기법을 사용한 경우로 보입니다. 상황에 따라 가치 표현이 달라지는 점도 확인되었습니다. 연구 결과는 다운로드 가능한 데이터셋과 함께 제공됩니다.

요약불가

RepliBench, 언어모델 에이전트의 자율적 복제 능력을 평가(2025.4.21)

연구 · arXiv · 🔓

언어모델 에이전트의 통제 불가능한 자율적 복제는 안전 위험이 될 수 있어, 이를 측정하기 위한 평가 모음 RepliBench를 제안했다. RepliBench는 자원 확보, 모델 가중치 유출, 컴퓨팅에 복제, 장기간 지속을 4개 핵심 영역으로 분해하고, 20개 과제군(총 86개 과제)으로 5개 최신 모델을 벤치마크했다. 결과적으로 모델들은 현재는 자기복제에 대한 ‘credible threat’ 수준은 아니지만 여러 구성요소에서는 성과를 보였으며, 최상위 모델(Claude 3.7 Sonnet)은 20개 과제군 중 15개에서 pass@10이 50%를 넘고, 가장 어려운 변형에서는 9개 과제군에서 50%를 넘었다. 다만 KYC 통과나 견고하고 지속적인 에이전트 배치 설정에서는 어려움을 겪어, 해당 영역 개선 또는 인간 보조가 있으면 자율적 복제 역량이 더 나타날 수 있다고 본다.