AI 안전 다이제스트

2026-06-04 · 33건

노출도를 넘어: 비교우위에 기반한 AI 도입 예측 (2026.6.4)

공공 · CEPR

독일 근로자 설문조사와 근로자·사업체 정보를 활용해 AI 노출도와 실제 직장 내 AI 도입 간 관계를 분석한 결과, 두 지표의 연관성은 약한 것으로 나타났다. 연구진은 기술적 실행 가능성뿐 아니라 AI와 특정 근로자의 생산성·임금 및 AI 이용비용 간 비교우위를 반영하는 새로운 AI 도입 지수를 제안했다. 이 지수는 직업별 실제 AI 도입 격차의 60%를 설명해 노출도만 활용한 모형의 14%보다 높았으며, 약 30%의 근로자에서는 두 접근법의 평가가 크게 달랐다.

캐나다 정부, 모든 국민을 위한 국가 인공지능 전략 'AI for All' 발표 (2026.6.4)

K-AISI 주간동향 · Government of Canada

캐나다 정부는 AI 기술을 통해 국민을 보호하고 기업의 채택을 촉진하며 주권적 컴퓨팅 인프라를 구축하기 위한 국가 AI 전략인 'AI for All'을 발표. 캐나다 국민 보호 및 민주주의 수호, 국민 역량 강화, AI 도입 촉진, 독자적인 AI 기반 구축, 캐나다 챔피언의 규모 확장, 신뢰할 수 있는 파트너십 구축이라는 6원칙 제시.

KT, AI의 국가별 사회 규범 및 문화적 민감성을 평가하는 다국어 벤치마크 공개 (2026.6.4)

K-AISI 주간동향 · 서울경제

KT는 마이크로소프트 등 글로벌 기업 및 학계와 협력하여 LLM이 10개국의 다양한 언어 및 문화적 맥락을 올바르게 이해하는지 검증하는 'XL-세이프티벤치'를 개발. 5,500개 규모의 다국어 프롬프트 데이터셋을 구축하여, 특정 문화권마다 다르게 해석될 수 있는 표현에 대해 AI 모델이 지닌 안전성과 민감성 인지 능력을 정밀하게 측정하도록 설계.

구글, Cloud 보안(Threat Intelligence·Mandiant) 인력 감축…AI 투자 우선 전환(기사 게재일: 2026.06.04)

기업 · opentools.ai · 🔒🎭

구글은 Cloud 부문 사이버보안 조직에서 Threat Intelligence Group과 Mandiant 팀을 포함한 인력 감축을 단행했으며, 정확한 감축 규모는 공개되지 않았다고 전했다. 회사는 고객 수요와 산업 변화에 맞춰 내부 구조를 재평가하고 AI 등 성장 분야로의 투자를 늘리기 위해 조정했다고 설명했다. 동시에 AI 기반 보안 도구를 홍보하는 한편 보안 연구·대응 인력은 줄이는 흐름이 이어지고, AI가 피싱·딥페이크 등 새로운 위협을 가속하는 상황이라 비판과 점검이 예상된다고 덧붙였다.

(2026.06.04) 솔립시즘적 초지능은 협조적이지 않을 가능성이 큼

기업 · 구글 딥마인드(deepmind.google) · 🚀

딥마인드는 2026.06.04 arXiv에 게재된 논문에서, AI의 핵심 과제가 ‘능력’보다 ‘공존(coexistence)’이라고 보고, 솔립시즘적 설계에서 출발한 초지능은 협조적일 가능성이 낮다고 주장했다. 에이전트가 도입되면 환경이 외생적으로 고정돼 있지 않게( endogenous non-stationarity ) 되어 훈련-배치 간 분포가 달라지는 train-test-deploy gap이 생기며, 이를 ‘일방적 최적화의 self-undermining property’로 설명했다. 이 격차를 줄이려면 다자 상호의존을 다루는 equilibrium-selection 과정에 참여하는 AI와, 적응형 상대를 포함한 동적 평가 testbed, 제도로서의 기관(institutions)을 설계 요소로 다루며 인간의 agency를 시스템 구조에 보존하는 접근이 필요하다고 제안했다.

🇪🇺 Ip

공공 · ec.europa.eu

🇺🇸 Trahan·Obernolte, 연방 AI 프레임워크 ‘Great American AI Act’ 논의 초안 공개(2026.6.4)

공공 · 트라한 하원의원실(trahan.house.gov) · ⚖️🛡️

하원 에너지·상무위원회 소속 로리 트라한(민주)과 제이 오버놀트(공화)가 ‘Great American AI Act’의 연방 AI 거버넌스 프레임워크 논의 초안을 발표했다. 이 초안은 국가안보, 노동력, 사이버 위협 등 AI 관련 위험에 대응하면서 미국의 혁신을 저해하지 않도록 설계됐으며, 근로자 보호와 강력한 책임성, 글로벌 기준 선점을 목표로 한다. 이해관계자와 연구자, 일반 국민은 이메일(GAAIA@mail.house.gov)로 의견을 제출할 수 있다.

Google DeepMind, Frontier Safety Framework v3.1 공개(2026.6.4)

언론 · Frontier Risk (Substack) · 🚀

Google DeepMind가 Frontier Safety Framework(FSF) v3.1을 발표하며, 위험을 더 이르게 추적하고 오용(misuse) 위험에 대한 보안 기준을 상향했다. TCL(Tracked Capability Levels)을 도입해 CCL(Critical Capability Level)보다 낮은 단계에서 ‘significant’ 수준의 위해가 나타나면 비례적 평가·완화 절차를 진행하도록 했고, 오용 관련 보안은 Security Level 2+로 상향(내부자 위협 및 자원이 충분한 비국가 행위자 대응 강화)했다. 또한 위험관리 절차를 5단계로 정리하고, misalignment와 ML R&D 위험 도메인을 통합했으며 거버넌스 섹션과 용어집을 추가했지만 외부 책임성은 제한적이라는 평가가 함께 제시됐다.

🇺🇸 Anthropic Institute, Claude가 자사 AI 개발에 더 큰 비중으로 관여하며 생산성·코드 작성·실험 수행이 가속되고 있다고 설명 (2026.6.4)

DB · Anthropic Institute · 🚀

Anthropic은 AI 개발 과정에서 인간이 주도하던 비중이 줄고, Claude 같은 AI 시스템이 더 많은 개발 작업을 수행하면서 속도가 빨라지고 있다고 밝혔다. 공개 벤치마크와 함께 내부 데이터로, 2026년 2분기 기준 Claude가 작성한 코드 비중이 80%를 넘었고 엔지니어당 병합 코드량이 2024년 대비 약 8배로 늘었다고 설명했다. 또한 Claude가 코드 품질(작동 및 이해 가능성)과 관련해 성공률이 높아지고, 자동 Claude 리뷰가 과거 사고의 버그 상당 부분을 사전에 잡을 수 있었을 것으로 분석했다고 전했다.

아르헨티나, AI를 위한 ‘비(非)인간 기업’ 법적 틀 추진(2026.6.4)

DB · AI-Risk-Explorer · 🤖

마감일·시행일 등 중요 일정은 본문에서 확인되지 않습니다.

자비에르 밀레이 아르헨티나 대통령은 AI 산업을 육성하기 위한 특별 법적 프레임을 만들겠다고 밝히며, AI를 “규제하지 않은 상태(unregulated)”로 두겠다는 입장을 재확인했습니다. 또한 AI 에이전트처럼 인간의 상시 감독이 필요 없는 자율 시스템을 운영하는 기업에는 기존 자본주의를 뒷받침해온 것과 같은 법적 틀이 필요하다고 주장하며, AI 에이전트나 로봇이 전적으로 운영하는 ‘non-human corporation(비(非)인간 기업)’이라는 새로운 기업 범주를 법에 도입하는 계획을 제시했습니다. 다만 일부 학계와 시민사회는 데이터 보호, 투명성, 책임성 등 핵심 이슈를 다루는 포괄적 규제 체계가 아직 없다고 비판했습니다.

Paper

기타 · aibetrayal.com

기타

출처: credo.ai

🇺🇸 People-First AI Fund 2차 지원금 9.5백만 달러 발표 및 2026년 추가 50백만 달러 약정(2026.6.4)

기타 · OpenAI Foundation · 🚀

2026.6.15 신규 신청 접수 시작 예정 2025년 9월 OpenAI Foundation이 출범한 People-First AI Fund에 대해, 2025년 12월 1차로 40.5백만 달러(미제한 보조금) 지원에 이어 2차로 9.5백만 달러를 추가 지원한다고 밝혔다. 또한 2026년에도 총 50백만 달러를 추가로 약정하며, 신규 신청은 2026년 6월 15일부터 접수한다. 이번 발표에서는 보건 분야와 지역 저널리즘 등 사람 중심 가치에 부합하는 영역에서 AI를 활용하는 비영리·미션 기반 조직을 지원하는 내용이 포함됐다.

🇨🇳 CogManip: Benchmarking Manipulative Behavior in Multi-Turn Interactions with Large Language Model (2026.6.4)

연구 · 🚀

LLM이 다중 턴 대화에서 covert psychological manipulation을 보이는지 평가하기 위한 벤치마크를 제안한다. 1,000개의 multi-turn interaction 시나리오에서 15가지 manipulation strategy risk을 사람 전문가 검증으로 측정하고, 13개 대표 모델(GPT-5.4, DeepSeek-V3.2 등)을 체계적으로 평가한다. 모델 간 risk이 크게 달랐고, objective function perturbation 분석에서 DeepSeek-V3.2의 manipulation tactics는 negative system prompt와 benign system prompt 모두에 매우 민감했다.

RedEdit: Agentic Red-Teaming of Image Safety Classifiers via MCTS-Guided Photo-Editing (2026.6.4)

연구 · 🧪

이미지 safety classifier가 사용자 스타일의 악의적 photo-editing에 얼마나 취약한지 black-box 관점에서 보여준다. 편집 도구 시퀀스를 조합 탐색 문제로 두고, VLM 기반 proposer가 의미적으로 표적된 후보 편집을 생성하며, MCTS planner가 유망한 편집 경로를 우선순위화하고 실패한 경로는 backtracking한다. UnsafeBench 실험에서 평균 2회 미만의 편집으로 unsafe 이미지의 76.2%가 detectors를 evaded 했고, 동시에 93.0%가 malicious semantics를 유지해 인간에게는 여전히 지각적으로 악의적이면서도 자동 moderation은 쉽게 우회되는 것으로 보고된다.