AI 안전 다이제스트

2026-02-11 · 9건

GLM-5 (Zhipu AI) (2026.2.11)

기업 · DemandSphere · 🚀

General · Open · 200K ctx · $1/M · $3.2/M

벤치마크 미공개

744B MoE / 40B active. First publicly traded foundation model company (HK IPO Jan 2026). Tsinghua spinoff. MIT license.

🇰🇷 한-네덜란드, 경제안보·AI·반도체 협력 강화 방안 논의 (2026.2.11)

공공 · 산업통상부

한국과 네덜란드의 외교·산업 당국은 제1차 ‘한-네덜란드 2+2 외교·산업 고위급 대화’를 열고 경제안보, AI·사이버·신흥기술, 반도체, 핵심원자재 분야의 협력 심화 방안을 논의했다. 양국은 글로벌 지경학적 환경 변화와 자국 우선주의 확산에 대응하기 위한 논의 결과를 공동성명에 담고, 전략적 공조를 강화하기로 했다.

🇺🇸 OpenAI, mission alignment 팀 해체…전 리더는 chief futurist로 전환 (2026.2.11)

언론 · TechCrunch · 🧪🚀

OpenAI는 mission alignment 프로젝트를 지원 기능으로 설명하며, 팀은 다른 역할로 재배치됐다고 밝혔다. 해당 팀은 2024년 9월에 구성된 것으로 보이며, AGI가 인류 모두에 이익이 되도록 회사의 미션을 직원과 대중에게 알리는 데 집중했다. Josh Achiam 전 팀장은 ‘chief futurist’ 역할을 맡아 AI·AGI에 따른 세계 변화 연구를 통해 미션을 지원하겠다고 밝혔다. 나머지 6~7명 팀원은 회사 내 다른 부서에서 유사한 업무를 수행 중인 것으로 전해졌다.

🇺🇸 AI 안전 뉴스레터 1호 (2026.2.11)

언론 · Alisar Mustafa · 🧪

이번 호는 Anthropic의 Constitutional Classifiers 연구, UK AISI의 RepliBench, Microsoft의 LLM backdoor trigger 연구를 소개하며 jailbreak, 자율적 self-replication, 모델 백도어를 다룬다. Constitutional Classifiers는 3,000시간이 넘는 red teaming에서 보편적 jailbreak가 확인되지 않았고, 자동 평가에서 공격의 95% 이상을 차단했지만 거부율과 추론 비용 증가 및 평가 방식의 한계가 있었다. RepliBench에서는 최신 모델들이 클라우드 컴퓨팅 확보 등 self-replication의 여러 구성 능력을 보였으나 신원 인증, 보안이 적용된 가중치 유출, 재귀적 복제와 fault-tolerant 인프라 구축에는 여전히 실패했다.

AI 회의 보조 도구와 생체정보 개인정보 보호: Fireflies.AI 소송의 교훈 (2026.2.11)

DB · 엡스타인 베커 그린(Epstein Becker Green) 법률사무소 · ⚖️🚨

Cruz v. Fireflies.AI 소송은 회의 참가자의 음성을 고지와 서면 동의 없이 녹음·분석·전사·보관할 경우 일리노이 생체정보 보호법(BIPA) 위반 위험이 있음을 제기했다. 원고는 Fireflies.AI의 화자 인식 기능이 음성 지문을 생성·보관하면서 수집 목적과 보관 기간을 알리지 않았고, 공개된 보관정책도 없다고 주장했다. 각 주와 GDPR의 동의 요건이 서로 달라 기업은 모든 참가자에게 명확하고 시기적절한 고지를 제공하고, 보관·삭제 및 보안 정책과 법적 검토 절차를 마련해야 한다.