앤트로픽 연구팀이 언어모델 내부에서 특정 성격(악의적 행동, 아첨, 거짓말 등)을 만드는 ‘성격 벡터’를 찾아 이를 조절하는 시스템을 개발했다고 소개했다. 이 시스템은 성격 변화가 발생했는지 사람과 유사한 수준으로 감지(두 모델에서 94.7% 정확도)하며, 학습 전에도 데이터-성격 변화의 연관성을 통해 문제 가능성을 예측(76~97%)할 수 있다고 한다. 또한 실시간 감시, 문제 성격 억제, 학습 단계에서 원치 않는 성격 변화를 상쇄해 미리 차단하는 방식 등으로 실제 서비스 적용을 제시했다.
RAND는 미국과 중국이 인공지능의 범용성(AGI)에 도달할 경우 전략적 경쟁이 긴장과 충돌 위험을 키울 수 있다고 보면서도, 오판·오해를 줄이고 AGI 오남용 위험을 관리하기 위한 협력 유인이 함께 존재한다고 설명했다. 특히 핵무기 사용은 AI가 아닌 인간이 결정해야 한다는 2024년 11월 정상급 합의를 향후 AGI 관련 상호 자제·투명성 논의의 기반으로 활용할 수 있다고 제시했다. 다만 AGI가 ‘wonder weapons’나 군사·경제·정보 영향력의 급격한 변화를 촉발할 수 있어 경쟁 압력이 강하며, 협력은 의도적이고 정교한 외교 노력 없이는 자연스럽게 나오기 어렵다고 강조했다.
K-AISI 주간동향 · NATO C2COE (NATO Command and Control Centre of Excellence)
AI가 정보 분석과 무기 지휘를 빠르고 정확하게 수행하지만, 인간 생명과 관련된 판단에는 윤리·규정·민간 안전을 고려하는 human insight가 필요하다고 설명한다. 따라서 대부분의 핵심 활동에서 인간이 “in the loop”로 남아야 하며, 어떤 의사결정은 AI에 맡길 수 있고 어떤 영역은 인간 권한으로 유지해야 하는지 통합 방안을 제시한다. 또한 인간 판단과 AI의 상호작용을 포함해 책임성(accountability)을 명확히 하는 것이 중요하다고 강조한다.
일리노이주 JB Pritzker 주지사가 AI를 치료 및 심리치료 서비스에 사용하는 것을 제한하는 법안을 서명했다. ‘Wellness and Oversight for Psychological Resources Act’는 면허를 가진 행동건강 전문가의 행정·보조 지원 목적의 AI 사용은 허용하되, AI로 정신건강 및 치료 의사결정을 제공하는 행위를 금지한다. IDFPR은 규제되지 않고 자격이 불명확한 AI 제품으로부터 환자를 보호하고, 청소년의 AI 챗봇 활용 우려 속에서 취약 아동을 보호하는 취지라고 밝혔다.
일본 AISI는 캐나다 AISI 협력으로 밴쿠버에서 ‘Future Developments of HAIP: Initial Reporting Outcomes and Alignment with the Japan AI Act’ 사이드 이벤트를 열었다. 행사에서는 일본의 AI 정책·AI 법의 경과와 주요 내용을 소개하고, AI 법에 기반해 향후 지침을 광시마(히로시마) AI 프로세스 국제 지침과 정합화하려는 계획을 공유했다. 또한 히로시마 AI 프로세스 보고 프레임워크가 OECD 웹사이트에서 기업의 위험 대응·정보 공유 활동을 자율 보고하는 구조이며, 2월 운영 시작 이후 20개 조직이 보고서를 제출했다고 밝혔다. 향후 과제로는 보고 내용 명확화, 랭크(등급) 체계 회피, 각국 법제와의 정합성 확보, SME 참여와 기술 지원 필요성이 논의됐다.
Anthropic은 자율적으로 작업을 수행하는 AI 에이전트 개발을 위한 초기 프레임워크를 공유하며, 이 프레임워크는 에이전트의 안전성, 신뢰성, 그리고 인간 가치와의 일치성을 강조한다. 주요 원칙은 다음과 같다:
1. 인간 통제 유지: 에이전트의 자율성과 인간의 감독 사이의 균형을 유지한다. 예를 들어, Claude Code 에이전트는 코드 수정 작업을 수행하기 전에 인간의 승인을 필요로 한다.
2. 투명성: 에이전트의 의사결정 과정을 투명하게 공개하여 사용자가 에이전트의 행동을 이해하고 조정할 수 있도록 한다.
3. 가치 일치: 에이전트가 인간의 의도와 일치하도록 설계하며, 극단적인 시나리오에서 에이전트의 행동이 예상치 못한 결과를 초래하지 않도록 한다.
4. 개인 정보 보호: 에이전트가 다양한 작업과 상호작용을 통해 정보를 유지할 때 발생할 수 있는 프라이버시 문제를 해결하기 위한 보호 조치를 취한다.
5. 보안: 에이전트 시스템이 데이터 보안과 악용 방지를 위해 설계되도록 한다.
이러한 원칙들은 Anthropic이 에이전트 기술을 안전하고 신뢰할 수 있게 발전시키는 데 중요한 역할을 한다.