AI 안전 다이제스트

2026-03-13 · 6건

🇺🇸🇨🇳 Anthropic 연구팀의 AI 모델 행동 차이 탐색 도구 발표 (2026.3.13)

기업 · Anthropic Research · 🚀

Anthropic 연구팀은 새로운 AI 모델 간의 행동 차이를 자동으로 식별하는 도구를 개발했습니다. 기존 평가 방법이 알려진 위험만 감지할 수 있는 반면, 이 도구는 모델 간의 미묘한 위험 요소를 포함한 '알려지지 않은 미지의 요소'를 찾아낼 수 있습니다. 특히, 이 도구는 서로 다른 아키텍처를 가진 모델들 간의 차이를 비교하는 데 초점을 맞추고 있으며, 이를 통해 모델 개발자들이 모델의 새로운 위험 요소를 더 효과적으로 파악할 수 있게 합니다. 연구 결과, Qwen3-8B와 DeepSeek-R1-0528-Qwen3-8B 모델은 중국 공산당에 대한 편향된 표현을 조절하는 특징을 공유하고 있으며, Llama-3.1-8B-Instruct 모델은 미국 우월주의를 반영하는 특징을 가지고 있음을 확인했습니다. 이러한 발견은 모델 간의 미묘한 행동 차이를 이해하는 데 중요한 역할을 합니다.

🇪🇺 GPAI 코드 이행을 위한 ‘저작권 챕터’ 제2차 서명자 태스크포스 회의(2026.3.13)

공공 · 유럽연합 집행위원회(유럽 AI 사무국) 디지털 전략

유럽연합의 범용 AI(GPAI) 실천강령(코드 오브 프랙티스) 서명자 태스크포스 제2차 회의가 2026년 3월 13일 열렸고, 대부분의 서명자 대표가 참석했다. 회의는 저작권 챕터의 조치 1.4(저작권 침해 출력 완화)와 조치 1.5(불만 접수용 연락처 지정·운영)를 중심으로, 모델 생애주기 전반에서의 기술·조직적 완화 방안과 불만 처리 절차 구축 경험을 공유했다. 특히 조치 1.4에서는 라이선스 콘텐츠로 학습하고 출력-학습데이터 유사도를 측정하는 속성(어트리뷰션) 메커니즘을 활용하는 접근이 소개되었으며, 조치 1.5에서는 권리자 불만 접수 및 신속한 응답을 위한 조직적 준비가 논의됐다.

🇺🇸🇰🇷 AI 안전 뉴스레터 69호: 국방부, 앤트로픽, 국가안보 (2026.3.13)

공공 · 미국 인공지능 안전센터(CAIS) · 🛡️🦾🚀

미국 국방부는 자율무기와 미국인 대상 대규모 국내 감시에 대한 앤트로픽의 제한을 문제 삼아 회사를 국가안보상 공급망 위험으로 지정했으며, 앤트로픽은 이에 대해 법적 대응에 나섰다. 앤트로픽은 책임 있는 확장 정책 개정판에서 재앙적으로 유해한 AI를 절대 출시하지 않겠다는 핵심 안전 약속을 삭제했으며, 뉴스레터는 이를 첨단 AI 기업들의 안전 기준 완화 추세로 평가했다. 이 밖에 OpenAI의 군사용 드론 기술 시험과 GPT-5.4 출시, 주요 AI 기업들의 대규모 투자 유치 등이 소개됐고, CAIS의 AI·사회 펠로십 지원 마감일은 3월 24일로 안내됐다.

An Opportunity for Canada to Lead in AI Emergency Preparedness (2026.3.13)

공공 · TheFutureSociety · 🤖

캐나다 정부는 연방 차원의 긴급 대비 체계를 강화하기 위한 국민 의견 수렴 과정에서 인공지능(AI) 관련 위험에 대비할 필요성을 강조하고 있다. 최근 사건들, 예를 들어 브리티시 컬럼비아의 총기 사건에서 AI 챗봇과의 상호작용이 사건 해결에 중요한 역할을 했다는 점이 드러났지만, 당시 캐나다 당국은 이러한 정보를 통지받지 못했다. 현재 캐나다에는 AI 챗봇 개발사에 대한 규제가 없으며, 더욱 발전된 AI 시스템은 인간의 최소한의 감독 하에 복잡한 작업을 수행하고 목표를 추구한다.

이 문서는 캐나다 정부가 다음과 같은 조치를 취해야 한다고 제안한다: 1. AI 긴급 대비 전담 태스크포스 구성: 다양한 기관들이 참여하여 AI 관련 위험을 평가하고 대응 프레임워크를 개발한다. 2. AI 사건 보고 의무화: AI 인프라 운영자들이 심각한 AI 관련 사건을 보고하도록 법적 근거를 마련한다. 3. CAISI 설립: 캐나다 인공지능 안전 연구소(CAISI)를 설립하여 AI 에이전트 탐지, 검증, 격리 기술 연구를 수행한다. 4. 기관별 AI 위협 평가: 각 기관이 AI 관련 위협 평가를 수행하여 긴급 대비 체계에 통합한다. 5. AI 인프라 운영자의 역할 정의: 데이터 센터 제공자, 클라우드 서비스 공급자 등이 AI 긴급 상황에서 어떤 역할을 할지 명확히 정의한다.

이러한 조치들은 캐나다의 긴급 대비 체계를 AI 시대에 맞게 확장하고 국제적인 협력을 통해 글로벌 리더십을 발휘할 수 있는 기회를 제공한다.

LLMs Can Infer Political Alignment from Online Conversations (2026.3.13)

연구 · 🧪

온라인 대화에 나타난 단서만으로 LLM이 사용자의 숨은 정치 성향을 추정할 수 있다는 점과 그로 인한 프라이버시 위험을 보여준다. DebateOrg와 Reddit의 온라인 논의를 데이터로 사용해 텍스트 단위 추론을 사용자 단위로 집계하고, 정치 관련 도메인을 더 넓힐수록 정확도가 개선되는지를 평가한다. LLM은 전통적 머신러닝 모델보다 숨은 정치 성향 예측에서 유의하게 더 높은 정확도를 보이며, 예측 성능은 여러 텍스트 추론의 사용자 단위 집계와 politics-adjacent domain 확장 시 추가로 향상된다; 또한 명시적으로 정치적이지 않지만 정치 성향을 예측하는 데 높은 정보값을 갖는 단어들을 활용함을 보고한다.