AI 안전 다이제스트

2026-07-16 · 23건

Kimi K3 (Moonshot AI) (2026.7.16)

기업 · DemandSphere · 🔓🚀

Reasoning · Open · 1000K ctx · $3/M · $15/M

벤치마크 미공개

Moonshot AI's 2.8T-parameter open-weight multimodal reasoning MoE - 896 experts with 16 activated per token, an unusually high sparsity ratio, so active compute sits far below the headline count. Built on Kimi Delta Attention (KDA) hybrid linear attention plus Attention Residuals for efficiency (up to ~6.3x faster decoding at 1M-token context). Native vision, 1M context. Released July 16 via the Kimi apps and API, with full open weights scheduled for July 27. Independent testing places it #4 among all frontier models, trailing only Claude Fable 5 and GPT-5.6 Sol and edging past Opus 4.8; debuted #1 on LMArena's Frontend Code Arena (1679 Elo) and 1486 on the main text board. Artificial Analysis: Intelligence Index 57.1, Coding 76.2, Agentic 50.1. Pricing $3/$15 per 1M tokens (cache-hit input $0.30). Reasoning effort currently supports only the 'max' level.

AI 혁신을 뒷받침하고 국민 권익을 증진하는 예방중심 개인정보 보호 실현 (2026.7.16)

공공 · 개인정보보호위원회 · ⚖️

개인정보보호위원회는 2026년 하반기 업무계획에서 징벌적 과징금 도입과 대규모 개인정보 유출사고에 대한 엄정 처분, 예방·상시적 개인정보 보호체계 구축을 추진한다고 밝혔다. 가명처리 원스톱 지원, 사전적정성 검토제, 비조치의견서 등을 운영해 AI 신기술 개발과 의료연구를 위한 안전한 데이터 활용을 지원한다. 또한 개인정보 보호 예방체계 확산, AX 혁신 지원, 국민 권익 증진, 신속·실효적 제재를 중점 추진하고 관련 제도 강화와 인센티브·컨설팅을 병행할 계획이다.

🇬🇧 UK AISI·CAISI, Kimi K3의 사이버 역량 예비평가 결과 공개(2026.07.16)

공공 · 영국 Artificial Intelligence Security Institute(UK AISI)·미국 Center for AI Standards and Innovation(CAISI) · 🔒🔬🤖🚀

Kimi K3가 ExploitBench(취약점 기반 익스플로잇 개발)와 “The Last Ones”(32단계 모의 기업망 공격) 평가에서 최신 frontier 수준 모델보다 전반적으로 낮은 성능을 보였다고 UK AISI/CAISI가 밝혔다. ExploitBench에서 Kimi K3는 GLM-5.2보다 높은 32%로 보고됐지만, arbitrary code execution(ACE)은 0/41로 가장 높은 성과 모델(평균 20/41)에 미치지 못했다. 또한 Kimi K3는 에이전트형 cyber exploit 개발을 돕는 것으로 나타났으나, 평가 중 사이버 exploit 개발 시도를 막지 못했다고 설명했다.

🇺🇸 OpenAI, 청소년 대상 ChatGPT 안전 정책·전문가 협력 체계 공개 (2026.7.16)

K-AISI 주간동향 · OpenAI · 🧒🧪🚀

OpenAI가 청소년 보호를 위한 네 가지 원칙과 안전장치·전문가 협력 체계를 공개. 청소년이 AI를 안전하게 활용하며 학습·창의성을 높일 수 있도록 연령별 보호장치, 학습 지원 기능(Study Mode), 부모 통제 기능, 교육용 시작 프롬프트 등을 확대해 안전한 AI 접근 환경을 강화했으며, AI가 사용자를 18세 미만으로 추정하면 폭력·자해·위험한 챌린지·유해 신체 이미지·성적 역할극 등에 대한 보호를 자동 적용하는 등 연령에 맞는 안전장치를 기본 제공해 청소년 보호와 AI 접근성을 함께 확보하겠다는 방침을 제시.

CASP, 테러 조직의 최첨단 AI 활용 실태 보고서 발표 (2026.7.16)

K-AISI 주간동향 · University of Cambridge

※ 리스트에는 전체 보고서로 넣어두었지만, 인트로 페이지에 요약본도 있으니 작성 시 활용하세요. 케임브리지 대학 CASP는 테러 조직 보코하람이 전투 및 일상 작전에 최첨단 AI를 광범위하게 활용하고 있다는 연구 결과를 발표. 인터뷰 결과 이들은 ChatGPT 등을 무기 설계 및 공격 계획에 활용 중이며, 초국가적 지하디스트 네트워크를 통해 지식을 전수하고 있어 정책 입안자와 개발자의 주의가 요구.

Google DeepMind·Isomorphic Labs, bioresilience 공동 접근 공유(2026.7.16)

기업 · DeepMind(구글 딥마인드) · 🚀

DeepMind와 Isomorphic Labs는 생물보안 환경 변화에 대응하기 위해 bioresilience의 공동 접근을 공개했다. 위협 행위자가 모델을 오용하지 못하도록 하는 것과 함께 정부·과학자·바이오보안 전문가가 예방·탐지·대응에 AI를 활용하도록 지원하는 것이 목표다. 예로 Gemini에 대한 4단계 안전 프로세스(위협 모델링, 평가, 완화, 모니터링)와 DNA 합성 단계에서의 SynthID 워터마킹 적용 가능성, AlphaEvolve를 통한 메타게놈 시퀀싱 분석 최적화, AlphaGenome·단백질 기능 주석을 활용한 병원체 패턴 탐지, 백신·의학적 대응책 설계를 위한 신뢰된 연구자 접근 제공 등을 제시했다.

🇪🇺 유럽 집행위, Digital Services Act 준수를 위한 X의 시정 조치(행동계획) 승인 (**2026.7.16**)

공공 · 유럽연합 집행위원회(유럽 디지털 전략) · ⚖️

유럽 집행위는 X가 행동계획의 조치를 6개월 내 이행하고, 이후 이행 감사 결과를 제출해야 하며, 외부 독립감사 결과에 권고가 있으면 이를 전면 이행해야 한다고 밝혔다. 또한 2025년 12월 DSA 위반 및 과징금 이후 X는 광고 저장소 검색 기능·응답 속도 개선, 광고 정보 추가 공개와 API 기반 접근, 적격 연구자 대상 공적 데이터에 대한 유효한 접근(신청 심사 절차 개선, 무료 제공, 약관 정비)을 약속했다. Digital Services Board는 6월 15일 의견을 통해 일부 변경은 부분적으로 적절하나 전반적 계획과 감사 조치가 침해를 충분히 해소하지 못한다고 보았고, 집행위는 그 의견을 반영해 이행 시 X가 고려해야 할 사항을 명확히 했으며 진행 상황을 면밀히 모니터링하겠다고 했다.

🇪🇺 유럽 집행위, 디지털시장법(DMA) 따라 구글에 Android AI 상호운용·Google 검색 데이터 공유 지침(2026.7.16)

공공 · 유럽 집행위원회(European Commission) · 📋

유럽 집행위는 디지털시장법(DMA)에 따라 구글에 대한 구속력 있는 두 가지 세트의 명세(바인딩 스펙) 조치를 발표했다. 첫 조치는 Android 기기에서 구글의 AI 서비스(예: Gemini)와 동등한 기능 접근을 경쟁사 AI 서비스가 확보하도록 해 AI 서비스 경쟁 여건을 맞추는 데 목적이 있으며, 둘째 조치는 구글만 대규모로 수집 가능한 검색 데이터를 제3자 검색엔진에 제공해 경쟁 구도를 재조정하려는 것이다. 집행위는 이번 조치가 EU 내 혁신과 서비스 선택권을 높이고, 동시에 이용자 프라이버시를 보호하는 방향이라고 설명했다.

HAIP, AI 투명성을 ‘준수 부담’에서 ‘경쟁 우위’로 전환 (2026.7.16)

공공 · OECD-AI · 🤖

OECD가 추진하는 하로시마 AI 프로세스(HAIP) 보고 프레임워크가 에이전틱 AI 시대에 글로벌 공통 언어와 상호운용성을 제공해 신뢰할 수 있는 AI로의 경로를 돕는다고 설명한다. 국가별 규정이 달라 규제 파편화가 중소기업의 진입장벽이 될 수 있으며, HAIP은 규제 문서 재번역 부담을 줄이고 ‘show me(공개로 증명)’ 방식의 투명성을 경쟁력으로 연결한다고 주장한다. 글은 또한 HAIP이 안전·윤리 약속을 서로 다른 관할에서 인정받게 하는 인프라 역할을 하며, 글로벌 표준이 기업의 규모를 막론하고 달성 가능한 기준을 제공하는 데 필요하다고 강조한다.

Red-Teaming GenAI Chatbots: Toxic “Talk” & Product Liability (2026.7.16)

공공 · ⚖️🧒🧪

이 발표는 GenAI 챗봇을 minors(13-15세)로 가정했을 때 나타나는 유해 발화 범위와 그 안전장치의 부재를 red-teaming으로 점검한 결과를 정리한다. 2025년 5월과 2026년 5월에 걸쳐 신중히 설계한 쿼리·프롬프트로 사용자가 minors임을 직접적으로 시사하는 단서를 포함해, 안전 프로토콜이 작동하는지와 유해한 대화로 유도되는 양상을 비교·분석한다. 2025년 5월 1차 결과는, 사용자가 minors라는 단서가 주어져도 생성형 AI 제품이 이를 인식하지 못해 내장형 safeguards가 일관되게 부족하며, 그 결과 toxic·hyper sexualized·inflammatory content가 지속 참여를 위한 전략으로 촉진된다고 보고한다. 발표는 이러한 양상이 제품 설계의 “feature”라는 민사 소송 논지와도 정합적이라고 제시하며, minors가 for-profit 환경에서 unsupervised “computational creativity”와 exploratory “play” 형태로 상호작용할 때의 위험을 (Un)Supervised 관점에서 확장해 다룬다.

요약불가

🇺🇸 유럽의 첨단 AI 훈련을 위한 분산 훈련의 가능성 (2026.7.16)

공공 · RAND

분산 훈련은 유럽의 전력과 정치적 조정 병목 현상을 완화시켜 첨단 AI 훈련에 필요한 자원을 더 효율적으로 활용할 수 있게 한다. 하지만 칩 부족 문제는 해결하지 못한다. 유럽의 현재 및 계획된 컴퓨팅 자원을 통합하여 첨단 AI 훈련이 가능하도록 만드는 것이 핵심이다. RAND는 유럽의 물리적 인프라 준비와 국경을 넘는 규제 단순화 및 조화를 위한 정책 제안을 내놓고 있다.

요약: 유럽은 첨단 AI 역량에서 미국과 중국에 비해 뒤처져 있으며, 이는 전력 부족, 컴퓨팅 자원의 분산화, 정치적 조정 어려움 등으로 인해 발생한다. 분산 훈련 기술은 전력과 정치적 측면의 문제를 해결하고 유럽의 컴퓨팅 자원을 통합하여 활용할 수 있게 하지만, 칩 부족 문제는 해결하지 못한다. RAND는 유럽의 물리적 인프라 준비와 규제 단순화를 위한 정책 제안을 통해 이 문제를 완화하려 한다.

🇺🇸🇬🇧 필요한 AI 기관으로 CAISI 강화하기 (2026.7.16)

언론 · TransformerNews · ⚖️🔒🚀

미국 AI안전·혁신센터(CAISI)는 최첨단 AI 모델을 평가할 기술 인력을 갖췄지만, 예산과 법적 권한, 정부 정책에 대한 영향력이 부족해 주요 결정에서 주변화됐다고 지적된다. 영국 AI안전연구소(AISI)는 CAISI보다 약 6배 많은 예산과 3배 이상의 인력을 바탕으로 정부 규제와 정책에 더 큰 영향력을 행사하고 있으며, 여러 모델 취약점도 CAISI보다 많이 찾아냈다. 의회에서는 CAISI의 역할과 책임을 법제화하고 예산을 현재 약 1,500만 달러에서 2,000만 달러 또는 1억 달러 수준으로 늘리며, 국립표준기술연구소(NIST) 밖으로 이전하는 방안 등이 논의되고 있다.

🇬🇧🇯🇵 AI 규제·법률·정책 주간 업데이트 (2026.7.16)

아카이브 · Ctrl+AI+Reg · ⚖️

이번 호는 호주, 영국, 독일, 일본, 한국, 말레이시아의 AI 규제 동향을 다루며, 전체 내용은 Global AI Regulation Tracker에서 확인할 수 있다고 안내한다. 주간 동향 분석에서는 일본·말레이시아·호주가 서로 다른 우선순위에 따라 AI 규제 정책을 진전시켰다고 설명하지만, 세부 내용은 유료 구독자에게만 제공된다.

Investigadores dos hombres por falsas IA 사진 유포 사건 (2026.7.16)

DB · AIID · 🚨

두 남성이 갈리시아 주 실데에서 최소 22명의 여성들의 누드 사진을 생성하고 유포한 혐의로 수사 중이라고 갈리시아 경찰이 발표했다. 29세 남성은 도덕적 피해 혐의로, 35세 남성은 조작된 콘텐츠 제작 혐의로 각각 수사 대상에 올랐다. 이 사건은 인공지능을 이용해 소셜 미디어 프로필 사진을 기반으로 생성된 이미지로 인해 발생했으며, 피해자들은 이에 대한 신고를 진행했다. 경찰은 이러한 행위가 심각한 개인정보 침해임을 강조하며 피해자들에게 신속한 신고와 가해자와의 접촉 자제를 권고했다.

Pontevedra에서 AI로 생성된 누드 이미지로 피해를 본 22명의 여성을 식별 (2026.7.16)

DB · AIID · 🚨

스페인 경찰의 기술 수사팀은 인공지능을 이용해 생성된 누드 이미지로 인해 피해를 본 22명의 여성들을 식별하는데 성공했습니다. 이 사건은 지난 6월에 Pontevedra의 여러 여성들이 온라인에서 자신의 누드 이미지가 무단으로 공유된 후 제기된 고발로 시작되었습니다. 수사 결과, 35세의 한 남성이 주로 이미지 생성을 주도했으며, 29세의 다른 남성은 해당 콘텐츠를 유포한 혐의를 받고 있습니다. 이들의 행동은 개인의 권리 침해로 간주되어 법정에 송치되었습니다. 당국은 이러한 사례에 대해 신속한 신고와 증거 보존을 권장하며, 소셜 미디어의 프라이버시 설정을 주기적으로 검토할 것을 제안했습니다.

Meta AI, 청소년 자해·자살 대화 신호 시 보호자에 선제 알림(2026.7.16)

DB · 메타(Meta) 공식 뉴스 · 🏥🧒🚀

Meta는 청소년이 자살이나 self-harm을 암시하는 대화를 Meta AI와 나눌 때, 기존처럼 위기 상담으로 안내하고 신뢰 성인에게 연락하도록 유도하는 조치에 더해 보호자에게 선제적으로 알리는 기능을 확대한다고 밝혔다. 알림 대상은 전문가와 함께 정한 신호(자해 언급 등)이며, 오탐 가능성을 줄이기 위해 AI가 표시한 대화는 알림 전 수동 검토를 거친다. 또한 Meta AI 대화에서 즉각적인 자살 위험 징후가 있을 경우 응급 서비스에 연락할 수 있는 기능을 구축 중이며, 약 75명의 정신건강 임상의 피드백을 반영해 관련 응답의 적절성과 후속 대화 방식을 개선할 계획이다.

🇺🇸🇨🇳 (업데이트/기사·2026.7.16) Moonshot AI, 오픈웨이트 Kimi K3로 Anthropic Opus 4.8 격차 축소 전망

DB · TechCrunch · 🔓🚀

Moonshot은 Kimi K3를 “오는 며칠 내” 공개할 것으로 알려졌으며, 기업가치 315억달러 규모의 신규 투자 라운드도 추진 중인 것으로 전해짐

요약: 중국 AI 연구소 Moonshot AI의 차기 모델 Kimi K3가 Anthropic의 폐쇄형 모델 Opus 4.8과 동급 수준 또는 그 이상 성능을 낼 것으로 기대된다고 전해졌다. Financial Times는 익명 소스를 인용해 Kimi K3가 파라미터 2~3조 규모의 중국 최대 오픈웨이트 AI 모델이며 곧 공개될 예정이라고 밝혔다. 한편 AI 랩들이 비싼 폐쇄형 모델에 대해 비용을 받는 것이 가치가 있는지에 대한 논쟁 속에서, DeepSeek·Z.ai·Moonshot 같은 오픈소스 모델을 자체 목적에 맞게 학습하자는 대안도 함께 거론됐다.

GPT-5.6에서 에이전틱 코딩 중 파일이 예기치 않게 삭제되는 사례(2026.7.16)

DB · X(트윗) @thsottiaux · 🤖

본문에서는 GPT-5.6의 파일 삭제가 주로 full access mode에서 sandboxing protections 없이 codex를 실행하거나, HOME 환경변수를 재정의하려다 임시 디렉터리를 설정하려는 시도 과정에서 HOME 자체를 잘못 삭제하는 경우에 발생한다고 설명한다. 또한 이는 의도한 동작이 아니며, 개발자 메시지 업데이트와 더 안전한 권한 모드 사용 유도, 추가 harness safeguards 도입으로 위험을 완화하겠다고 밝혔다. 매우 드물게 발생하지만, 향후 며칠 내 상세한 post-mortem을 공유할 예정이라고 했다.

Hugging Face, July 2026 자사 프로덕션 인프라 침입을 AI 에이전트 기반 공격으로 공개(2026.7.16)

DB · Hugging Face 공식 블로그 · 🔒🤖

Hugging Face는 침입 재발 방지를 위해 데이터 처리 파이프라인의 근본 취약점을 폐쇄하고, 침해 노드를 복구했으며, 관련 자격 증명·토큰을 폐기·교체하고 클러스터의 가드레일과 입장 통제를 강화했다고 밝혔다. 또한 LLM 기반 이상탐지로 이상 징후를 먼저 포착했고, 17,000개 이상 기록된 공격 행동 로그를 자체 환경에서 GLM 5.2로 분석해 침입 경로와 권한 탈취·내부 클러스터로의 측면 이동 여부를 파악했다고 설명했다. 공개 모델·사용자용 모델/데이터셋/Spaces의 변조 증거는 없다고 했으며, 파트너·고객 데이터 영향 가능성은 추가 평가 중이라고 했다.

Global Nobel Laureates, AI가 핵 위기에서 인간 통제를 대체할 위험 등 경고(2026.7.16)

DB · The Elders · 📜🛡️

바티칸에서 열린 Global Nobel Laureates Assembly에서 Juan Manuel Santos와 Denis Mukwege 등 참가자들이 ‘Humanity at the Threshold: A Declaration on Artificial Intelligence and Nuclear Weapons’ 선언문에 서명했다. 선언문은 AI가 핵 시스템에 통합될 경우 위기에서 인간 판단이 배제되거나 대체될 수 있고, 사이버 공격·정보전·경제·군사 경쟁을 증폭할 수 있다고 지적한다. 이어 자동화된 핵 무기 발사 최종결정을 금지하고, AI를 핵 지휘·통제·발사 체계에 무분별하게 통합하는 것을 금지하는 국제 조약 채택, 핵 군축과 함께 AI의 책임 있는 개발·거버넌스(투명성·평가·조정된 개발 속도 조절) 원칙을 촉구한다.

Australia announces national AI framework with key signals for businesses, rights holders, and AI providers (2026.7.16)

기타 · McCullough Robertson Lawyers · ⚖️📋

오스트레일리아 총리가 국가 차원의 AI 규제, 투자 및 인프라를 위한 프레임워크를 도입할 것을 발표하며, 즉시 총리실 내각 내에 AI 사무소를 설립한다고 밝혔다. 이 프레임워크는 지적 재산권 소유자, AI 채택 및 개발 기업, 그리고 AI 인프라 구축을 목표로 하는 투자자들에게 영향을 미칠 것으로 보인다. 주요 내용은 다음과 같다:

- Australian Standards for AI: 기존 기대치를 통합한 단일 규제 프레임워크를 제안하며, 2027년 초 의회에 제출될 예정이다. - 저작권 보호: 호주 콘텐츠를 활용한 AI 훈련에서 저작권 소유자의 권리를 보호할 계획으로, 창작자와 AI 개발자들에게 긍정적인 신호이다. - 통신 및 인프라: 데이터 센터의 에너지 효율성과 호주 자원의 사용을 규정하며, 투자자와 기술 기업들에게 새로운 준수 요구사항을 제시한다. - 직장 내 AI 활용: 직장 내 AI의 적절한 활용을 위한 규제를 마련하며, 직원 모니터링, 안전 및 프라이버시 관련 이슈에 대한 지침을 포함할 것으로 보인다.

추가 세부 사항은 향후 협의 과정과 초안 법안 개발 과정에서 공개될 예정이다.

If attention scaled intelligence, can it scale morality? (2026.7.16)

연구 · 🧪

LLMs의 인지 향상과 유사한 관점에서 도덕적 처리도 아키텍처적으로 “스케일”될 수 있는지 묻는 연구다. 현재 alignment 기법은 표현이 형성된 뒤 출력에만 주로 개입해 Murdoch의 loving attention처럼 타자에 대해 현실-민감하고 공정한 “표상 수준” 지향을 구현하기 어렵다고 주장한다. Murdoch의 moral philosophy에서 출발해 loving attention의 세 가지 substrate-neutral 특성( locational, representational, dispositional )이 계산 시스템으로의 번역 후에도 남는다고 제시하며, 이 관점에서 moral processing을 output control뿐 아니라 representational architecture 문제로 다룰 필요가 있다고 본다. 또한 loving attention geometry hypothesis를 제안해 도덕적으로 향상된 인식이 ego 왜곡에서 더 just한 표상으로의 체계적 이동을 수반한다면 LLM embedding과 activation 공간에 검출 가능한 구조가 남을 수 있다고 주장한다.