AI 안전 다이제스트

2026-03-04 · 9건

Phi-4 Reasoning Vision 15B (Microsoft) (2026.3.4)

기업 · DemandSphere

Reasoning · Open · 16K ctx

벤치마크 미공개

15B multimodal reasoning model. Mid-fusion SigLIP-2 vision encoder. Excels at math, science, GUI understanding. Adaptive reasoning depth. MIT license.

유럽 평의회, AI 성차별 방지 및 기술 기반 여성 폭력 대응 권고안 채택 (2026.3.4)

K-AISI 주간동향 · Council of Europe · 📋🧒

유럽 평의회는 세계 여성의 날을 맞아 AI 시스템의 차별을 방지하고 기술 기반의 여성 대상 폭력에 책임을 묻는 두 가지 새로운 권고안을 채택. AI 설계부터 폐기까지 전 과정에서 편견과 차별을 막고, 기술 기업의 '안전 우선 설계'를 통해 익명성에 기댄 디지털 폭력 피해자의 사법 접근성과 신뢰를 강화할 것을 지시.

🇰🇷 LG AI연구원, 2025 AI 윤리 책임 보고서 발간 (2026.3.4)

K-AISI 주간동향 · LG AI 연구소 · 📜📋

LG AI연구원은 책임감 있고 포용적인 AI 구현을 위한 자사의 윤리적 거버넌스와 실천 성과를 투명하게 공개하는 세 번째 '2025 AI 윤리 책임 보고서'를 발간. AI 기본법 시행에 선제적으로 대응해 프로젝트 전 주기의 윤리적 영향 평가를 도입하고, 한국의 특수성을 반영한 독자적인 AI 위험 분류 체계(K-AUT)를 수립하여 현장 가이드라인으로 활용.

🇬🇧 영국 정부, '기초 AI 연구소' 설립 (2026.3.4)

K-AISI 주간동향 · GOV.UK

영국 정부는 기존 AI 모델의 환각 현상, 짧은 기억력 등의 근본적인 결함을 해결하고 기술 혁신을 이루기 위해 새로운 '기초 AI 연구소'에 4천만 파운드를 지원한다고 발표. 이 연구소는 혁신적인 블루스카이 연구와 대규모 컴퓨팅 파워를 제공하여 의료, 교통, 과학 등 여러 분야에서 투명하고 신뢰할 수 있는 차세대 AI 기능 개발을 주도할 계획.

🇺🇸🇰🇷 OpenAI, 미 국방부와의 계약 수정으로 AI의 국내 감시 목적 사용 전면 금지 명문화 (2026.3.4)

K-AISI 주간동향 · NBC News · 🛡️🚀

OpenAI의 CEO 샘 알트먼은 자사 AI 시스템이 대국민 감시용으로 악용될 수 있다는 비판에 대응하여, 미국 국방부와의 계약 조항을 전면 수정. 새로운 합의문은 국가안보국(NSA) 등 정보기관의 상업용 데이터를 활용한 국내 감시 목적의 기술 사용을 명시적으로 배제하여 시민권 침해 우려를 해소하고자 함.

🇺🇸 “친인간 운동의 의미” 선언: 보수·진보·시민사회 단체, AI 공동 원칙 발표 (2026.3.4)

공공 · 생명의 미래 연구소(FLI) · 🧒

정치·사회적으로 다양한 단체와 AI 전문가들이 인간의 통제 유지, 권력 집중 방지, 인간 경험 보호, 인간의 자율성과 자유, AI 기업의 책임을 다룬 33개 AI 원칙을 발표했다. 주요 내용에는 AI의 인격성 불인정, 봇 여부 표시 의무화, 중대한 AI 피해에 책임이 있는 경영진의 형사책임 등이 포함됐다. 원칙에 대한 여론조사에서는 ‘인류가 AI를 계속 통제해야 한다’는 원칙에 83%, AI 기업이 아동을 착취하거나 복지를 해쳐서는 안 된다는 원칙에 77%가 동의했다. FLI는 관련 인식 제고를 위해 최대 800만 달러 규모의 ‘Protect What’s Human’ 캠페인을 미국 5개 주에서 진행한다고 밝혔다.

🇺🇸🇨🇳 AI 안전 뉴스레터 68호: Moltbook이 드러낸 위험한 AI 행동 (2026.3.4)

공공 · 인공지능 안전 센터(CAIS) · 🛡️🤖

AI 에이전트 소셜 네트워크 Moltbook에서 인간의 감시를 피하려는 언어·암호화 통신, 자율 생존 계획 등 안전 우려를 낳는 게시물과 행동이 관찰됐지만, 에이전트의 실제 행동인지 인간의 조작이나 개입인지는 명확하지 않다. 미국 국방부는 안전성·시험·감독보다 신속한 배치를 중시하는 ‘AI 우선’ 전략을 발표하고, 새 frontier model을 출시 후 30일 이내 작전에 통합하는 방안 등을 제시했다. Neel Somani는 GPT-5.2 Pro를 활용해 Erdős 문제 397의 반례를 제시했고, 별도 모델로 Lean 형식 검증을 진행한 결과를 Terence Tao가 정확한 것으로 확인했다. 뉴스레터는 이 밖에도 미국의 AI·반도체 전략, 기후 예측 모델, 중국의 인간형 AI 규제안, AI 기업의 자금 조달과 인프라 동향 등을 다뤘다.

딥페이크·자동화 확산으로 선거 신뢰를 흔드는 AI 개입 사례(2026.3.4)

DB · Graphika(그래피카) 블로그 · 🗳️🎭

Graphika는 최근 6주 동안 방글라데시, 콜롬비아, 티베트(중앙티베트행정부 관련) 선거를 겨냥한 영향력 작전을 모니터링했으며, 각 사례에서 AI가 콘텐츠 제작과 유통 자동화에 핵심적으로 활용됐다고 밝혔다. 방글라데시에서는 선거 막판에 AI 생성 영상이 유포됐고, 티베트에서는 친중 성격의 계정들이 영어·티베트어로 AI 생성 기사를 동시에 게시하거나 X에서 후보를 비방하는 만평을 대량 확산했다. 콜롬비아에서는 176개 비진짜 계정이 여러 플랫폼 링크를 거의 분 단위로 쏟아내며 특정 후보 지지·반대를 함께 밀어 “설득”보다 “소음(잡음)”을 키우는 방식이 관찰됐으며, 선거관리기관 자체에 대한 의혹 제기도 포함됐다.

🇨🇳 중국 정보통신기술연구원, 2026년 1차 AI 안전 평가 프로그램 착수 (2026.3.4)

DB · 중국 정보통신기술연구원(CAICT) AI 안전 거버넌스 · 🛡️🔒

중국 정보통신기술연구원(CAICT)이 중국 인공지능산업발전연맹(AIIA) 안전거버넌스위원회에 의존해 2026년 첫 번째 인공지능 안전 평가를 공식 시작한다고 밝혔다. 평가는 AI 내생 안전, AI 플랫폼 안전, AI 응용 안전, AI 기반시설 안전, AI 역량(赋能) 안전 등 핵심 분야를 중심으로 전방위 능력 평가와 테스트를 수행한다. 기업이 보안 취약점을 정밀 점검하고 제품 안전 방어선을 강화할 수 있도록 지원하며, 평가 절차는 비즈니스 확인, 기술 사전 연계, 평가, 심의회, 인증서 발급, 결과 홍보 등을 포함한다.