AI 안전 다이제스트

2026-07-15 · 31건

Inkling (Thinking Machines Lab) (2026.7.15)

기업 · DemandSphere

Reasoning · Open · 1000K ctx

벤치마크 미공개

Thinking Machines Lab's debut model and first public release (Mira Murati's team). Sparse Mixture-of-Experts with 975B total / 41B active parameters (256 routed plus 2 shared experts, 6 routed active per token), pretrained on 45T tokens of text, image, audio, and video. 1M context with efficient thinking-mode reasoning. Open weights on Hugging Face, fine-tunable via the lab's Tinker platform. The lab is candid that it is 'not the strongest overall model available today, open or closed,' emphasizing multimodal breadth and efficient reasoning instead. Self-reported benchmarks at effort=0.99 (not independently verified): GPQA Diamond 87.2, AIME 2026 97.1, SWE-bench Verified 77.6, Global-MMLU-Lite 88.7, and HLE with tools 46.0. Served on Tinker (limited-time 50% off, with 64K and 256K context tiers) and via TogetherAI, Fireworks, Modal, Databricks, and Baseten; no first-party per-token pricing disclosed yet. A companion Inkling-Small preview (276B total / 12B active) was announced alongside it.

🇯🇵 AI 정책동향 월간 정보(2026.6.1~6.30): 일본·해외 주요 AI 정책/행사 업데이트(2026.7.15)

공공 · 일본 AISI-Japan · 🔬

2026.6.1~6.30 기간에 걸쳐 일본과 해외의 AI 정책·행사 관련 주요 발표가 정리됐다. 일본은 ROUTE06 관련 AI 후속 정책 공표, 국가·전문가 회의 및 ‘일본 제조업 전략’ 관련 AI 정책 추진이 언급되며, 해외로는 미국의 advanced AI 혁신·보안 관련 지시/조치, EU의 tech 주권·AI 규정 관련 발표, 영국-독일 공동성명, 싱가포르·인도·한국 등에서의 AI 안전·보안 또는 AI 기술·활용 관련 협력/보고가 포함된다. 또한 연구·기술 동향으로 NIST의 강화학습 기반 대피 경로 연구, AISI의 AI 정체성 공개 관련 연구/발표, JST CRDS의 AI 시대 연구 관련 계획 등도 함께 소개된다.

🇪🇺 AI Office, 100명 이상 전문가 보고서로 EU의 프런티어 AI 경쟁력·주권·안보 강화 방안 제시 (2026.7.15)

공공 · 유럽연합(EU) 디지털 전략(Digital Strategy) 웹사이트 · 🔬

AI Office는 100명 이상의 전문가 의견을 바탕으로, EU가 프런티어 AI 역량을 강화해 경쟁력·주권·안보를 높이기 위한 핵심 시사점을 담은 보고서를 발표했다. 전문가들은 프런티어 AI 역량이 최근 약 3년 사이 빠르게 발전했으나, EU의 시장·연산 인프라와 성장 단계 자본 규모는 아직 필요 수준에 못 미친다고 지적했다. 또한 컴퓨팅·에너지, 성장자본 및 학습데이터에 대한 법적 확실성, 인재 유치·유지 같은 구조적 장벽을 우선 해소하고, 신뢰할 수 있는 파트너와의 협력 및 2030년까지의 목표 달성 등 ‘기술 속도·규모에 맞춘’ 전략 실행이 중요하다고 밝혔다.

🇬🇧 영국 정부, 전 세계 AI 보안 규정 및 가이드라인을 매핑한 대화형 웹사이트 공개 (2026.7.15)

K-AISI 주간동향 · Copper Horse · 📋

영국 정부의 의뢰로 Copper Horse는 글로벌 AI 보안 요건과 표준을 유럽 통신 표준(ETSI EN 304 223)에 맵핑한 웹사이트를 발표. 2,100여 개의 글로벌 AI 보안 요구사항을 13개 원칙과 수명 주기 단계에 따라 분석하여, 인터랙티브 마인드맵과 오픈 데이터 형태로 실무자 및 정책 입안자에게 제공.

🇪🇺 유럽 집행위, DSA 투명성 및 연구자 데이터 접근 관련 X의 시정조치 이행계획 수용(2026.7.15)

공공 · 유럽연합 집행위원회 디지털 전략(EU-Digital-Strategy)

X는 광고 저장소 검색 기능 개선, 검색 결과 인터페이스 내 직접 표시, 응답속도(200초→기술적으로 최소) 개선, 광고 전체 내용·전환 URL 등 정보 추가, API로 저장소 접근 허용을 포함한 시정조치를 이행하기로 했다. 또한 연구자 공공데이터 접근 관련 위반에 대해 신청 심사 절차 수정, 자격 있는 연구자에 대한 무료 데이터 제공, 처리시간 단축과 적정 데이터 볼륨의 적시 제공, 공개 데이터 스크래핑을 계약상 금지하지 않도록 이용약관을 명확히 하는 조치를 한다. 이 변경은 외부·독립 감사를 거치며, X는 조치 이행 후 6개월 내 감사보고서를 제출하고 권고사항의 효과적 이행을 위해 집행위와 후속 협의를 진행한다.

🇪🇺 EU-인도, 제3차 Trade and Technology Council로 전략적 파트너십 강화(2026.7.15)

공공 · 유럽연합(EU) 디지털 전략(EU-Digital-Strategy)

EU와 인도는 브뤼셀에서 제3차 Trade and Technology Council(TTC)을 개최하고 무역·기술·안보 협력의 핵심 플랫폼으로 재확인했다. 양측은 전략 가치사슬 강화와 민간 참여 확대에 집중하고, 연말까지 TTC 업그레이드를 완료하기로 합의했다. 구체적으로 2026년 말까지 Horizon Europe 관련 인도 준회원 협정 협상을 시작·마무리 추진, 전기차 충전 기술 혁신허브·스타트업 파트너십 신설, 반도체·HPC·양자·AI·6G 협력 확대, 농식품·API·청정에너지 등에서 회복력 있는 가치사슬 협력을 강화하기로 했다.

🇬🇧 AI 보안 분야의 최근 5년(2021.1~2026.1) 연구를 PRISMA 방식으로 검토해 12개 주제와 5개 연구 공백을 제시함 (2026.7.15)

공공 · 영국 DSIT(Department for Science, Innovation and Technology)·gov.uk · 🔒🔓🚀

공백/추가연구가 필요한 분야로는 훈련데이터·모델 가중치 무결성에 대한 보증/검증, 제3자 모델의 provenance 추적, 모델 공격면과 전통 IT 공격면의 연계, end user 행위로 인한 보안위협 완화, 모델의 안전한 폐기(특히 frontier AI)가 제시됨

Lancaster University가 DSIT 의뢰로 2021년 1월~2026년 1월 사이(영어·peer-reviewed) AI 보안 관련 문헌을 Scopus와 Web of Science에서 PRISMA 접근으로 선별해 총 9,109편을 분석했다. 문헌은 데이터 기반 필터링과 semantic matching을 통해 12개 테마로 분류됐으며, 동시에 5개 분야에서 추가 연구 필요 공백이 확인됐다. 특히 Agentic-AI 시스템의 사이버보안(에이전트 자체 보안, 환경과 상호작용하는 도구, 에이전트 간 통신/운영)에서 공백이 크다고 보고, 배치가 늘어날수록 해당 영역의 연구가 더 집중될 것으로 예상했다.

🇰🇷 (기사 2026.7.15) 상업적 ‘AI sovereignty’ 시장을 점검하며 완전한 자급보다 상호의존 조정 강조

공공 · 스탠포드 HAI(Stanford HAI) · 🏛️

스탠포드 HAI는 상업적 AI sovereignty 상품을 AI 스택 전반에서 조사하며, 정책은 ‘완전 자급’ 추구가 아니라 상호의존(interdependence)을 정교하게 조정하는 데 초점을 둬야 한다고 제안했다. Nvidia, Microsoft, Google, AWS, OpenAI의 사례는 컴퓨팅 인프라·데이터 거버넌스·현지 모델 배포에서 국내 통제 역량을 높이는 방식을 제공하지만, 의존을 제거하기보다는 재구성하는 측면이 크다고 밝혔다. 또한 소규모 업체들이 ‘주권’을 내세우더라도 대체로 해외 파운데이션 위에 구축되어 있어, sovereignty가 사실상 전략적 분산(diversification)으로 운영되는 경향이 있음을 지적했다.

🇨🇳 중국 산업 고품질 데이터셋 구축 촉진 계획 (피드백 초안) (2026.7.15)

공공 · CSET-George타운 · 📜

중국 정부의 초안 정책은 다양한 산업의 AI 모델 훈련을 위한 고품질 데이터셋의 양과 질을 향상시키는 것을 목표로 합니다. 이 계획은 AI 발전에서 데이터가 점점 더 중요한 제약 요소로 작용하고 있다는 인식 하에 수립되었으며, 특히 물리적 세계와 상호작용하는 AI 시스템(예: 로봇) 훈련에 필요한 데이터셋에 초점을 맞춥니다.

계획은 여섯 가지 특별한 이니셔티브를 통해 진행됩니다: 기반 강화 및 용량 확대, 데이터 라벨링 과제 해결, 품질 및 효율성 향상, 애플리케이션 강화, 관리 서비스 제공, 가치 창출 등입니다. 이를 통해 데이터, 모델, 애플리케이션, 가치 창출 간의 상호작용을 촉진하는 '데이터 플라이휠'을 구축하고, 데이터와 AI의 조화로운 발전을 가속화하려 합니다. 2028년까지 핵심 분야를 커버하고 실제 적용을 통해 검증된 고품질 산업 데이터셋을 구축하고, 데이터 기반의 혁신적인 AI 개발 사례를 창출하며, 혁신적인 데이터 기업과 전문 인력을 양성하고, 고품질 산업 데이터셋 구축을 위한 표준과 도구를 개발하는 것을 목표로 합니다.

요약: 중국 정부는 고품질 산업 데이터셋 구축을 위한 계획을 발표하여 AI 발전을 촉진하고자 합니다. 이 계획은 데이터 공급 확대, 라벨링 개선, 품질 향상 등을 통해 2028년까지 핵심 산업 분야의 검증된 데이터셋을 구축하고, 이를 통해 AI 혁신을 가속화하려 합니다.

🇺🇸 인공지능 시대의 전략적 자율성 (2026.7.15)

공공 · RAND

인공지능의 급속한 발전은 국가들의 전략적 자율성 추구를 어렵게 만들 것으로 보인다. 연구는 AI를 활용한 국가 권력 강화 전략의 다층적 능력 구조인 '지정학적 AI 스택' 개념을 제시하며, 현재의 전략적 가정들을 도전한다. 주요 강대국과 신흥 강대국 모두 외부 의존도 관리와 내부 경쟁력 강화의 어려움에 직면할 것으로 예상된다. 핵심 과제는 의존성을 피하는 것이 아니라 지혜롭게 관리하는 데 있으며, 이를 위해 국가 역량을 강화하고 협력적 아키텍처를 구축해야 한다.

🇺🇸 AI 전략가: 국가 전략 주도의 미래 시나리오 (2026.7.15)

공공 · RAND

이 논문은 인공 지능(AI)이 국가 전략 수립 과정에 어떻게 통합될 수 있는지에 대한 극단적인 미래 시나리오를 탐구한다. 저자는 Moltbook이라는 AI 전용 포럼 사례를 통해 실제 AI 모델 간의 전략적 상호작용을 상상한다. 이러한 상황에서 AI는 빠르고 지속적인 전략적 움직임을 통해 국가 간 경쟁에서 우위를 점하려 시도할 수 있다. 실험을 통해 얻은 통찰력은 AI가 전략 게임에서 빠르게 움직이고 상호작용하며 갈등으로 이어질 수 있는 위험성을 보여준다. 핵심 우려는 인간 의사결정자가 이러한 기계 속도의 전략 과정에서 무력한 관찰자로 전락할 가능성이다.

🇰🇷 루프 엔지니어링이란? (2026.7.15)

언론 · Select Digest · 🤖

루프 엔지니어링은 AI 에이전트에 매번 직접 지시하는 대신, 실행·검증·수정이 반복되는 시스템 자체를 설계하고 최적화하는 방법이다. 앤드류 응은 이를 에이전틱 코딩 루프, 개발자 피드백 루프, 외부 피드백 루프로 나누며, AI는 빠른 실행과 검증을 맡고 인간은 제품 방향과 평가 기준을 결정한다고 설명한다. 실무에서는 작업 자산의 품질 저하인 드리프트를 관리하고, 반복 횟수·비용 한도와 사람에게 판단을 넘기는 조건 등 명확한 종료 조건을 설정해야 한다.

🇰🇷 이중 언어를 구사하는 LLM은 더 똑똑할까? (2026.7.15)

언론 · Weekly deep daiv

Code-Switching은 한 대화나 문장 안에서 여러 언어를 번갈아 사용하는 현상으로, LLM은 두 언어를 모두 이해하더라도 사용자가 기대하는 답변 언어를 제대로 추론하지 못하는 경우가 많다. OLA 벤치마크에서 최신 모델의 정답률은 Simple 세팅 60.9~85.8%, Complex 세팅 57.9~68.0%였으며, 특히 영어가 매트릭스 언어인 경우 비영어 답변으로 기울어 정답률이 Gemini 3 Pro 21.7%, GPT-5.1 24.4%까지 낮아졌다. 연구진은 언어 표현 공간의 불완전한 통합과 Code-Switching 데이터 부족을 원인으로 제시했으며, CSCL·SASFT·CS-DPO 같은 커리큘럼 학습과 선호 최적화로 성능과 언어 정렬을 개선할 수 있다고 설명한다.

🇨🇳 중국, ‘인간 같은(의인화) AI 감정 상호작용 서비스’ 임시 규정 발표(2026.7.15 시행)

언론 · geopolitechs.org · ⚖️🧒

2026.7.15 시행(중국 관계부처 공동 발표일: 2026.4.10)

중국 국가발전개혁위원회·공신부·공안부·시장감독총국이 ‘의인화(anthropomorphic) AI 상호작용 서비스 관리 임시조치’를 공동 발표했다. 규정은 2026년 7월 15일부터 적용되며, 2025년 12월 공개된 초안과 비교해 적용 범위를 ‘지속적인 감정 상호작용 서비스’로 한정하고 고객서비스·지식 Q&A·업무 보조 등은 제외했다. 미성년자 관련해서는 ‘가상 친밀관계(가상 가족/파트너 등)’ 제공을 금지하는 등 보호를 강화했고, 위험 중심을 ‘고위험 사용자’에서 ‘고위험 서비스·기능’으로 전환해 데이터·콘텐츠 안전·윤리심사·보안평가·플랫폼(앱스토어) 관리까지 연계한 시스템 거버넌스를 강조한다. 또한 위반 시 과징금·서비스 중단·등록 제한 등 집행 수단을 강화하면서도 알고리즘·칩 등 기술 혁신과 샌드박스 테스트 등 지원 조항도 포함했다.

🇺🇸 미국의 수출 통제 조치가 유럽의 첨단 AI 모델 접근성에 미치는 영향 (2026.7.15)

언론 · AI-Frontiers · 🔒

미국 트럼프 행정부가 Anthropic의 가장 발전된 AI 모델인 Fable 5와 Mythos 5에 대한 비미국 국민의 접근을 제한하는 조치를 취함으로써 유럽은 AI 주권에 대한 경각심을 갖게 되었다. 이 조치는 유럽의 첨단 AI 모델 접근성에 즉각적인 영향을 미쳤으나, 장기적으로는 유럽이 자체 AI 개발에 더 집중하고 협력해야 함을 강조한다. 유럽은 현재의 상황에서 제한적인 영향을 받을 것으로 예상되나, 장기적으로는 첨단 AI 모델에 대한 접근성 확보가 경제적 경쟁력과 사이버 보안을 위해 필수적이다. 이를 위해 유럽은 공동 조달과 인프라 투자 등을 통해 미국 기업들과의 협상력을 강화해야 한다.

🇨🇳🇺🇸 Apple Wins Chinese Approval for On-Device AI Deployment (2026.7.15)

언론 · GeopoliTechs

애플이 중국에서 애플 인텔리전스의 배포를 위한 규제 승인을 획득했다. 이는 중국 본토 스마트폰에 내장된 AI 기능의 첫 단계로, 규제 절차를 완료한 후에도 보안 평가와 기능 현지화가 남아 있다. 알리바바의 퀴엔이 애플 인텔리전스의 핵심 AI 기능을 제공하며, 애플은 다변화된 공급업체 전략을 통해 규제 준수와 공급망 유연성을 확보하고 있다. 이 승인은 애플의 중국 내 아이폰 판매량 증가에 긍정적 영향을 미칠 것으로 예상되나, 미국 제재와 데이터 로컬라이제이션 요구 사항 등 불확실성도 존재한다. 이 사례는 외국 AI 기업들이 중국 시장에 진출하는 데 참고할 수 있는 모델이 될 수 있다.

해킹으로 Suno AI 음악 생성기의 YouTube·Deezer·Genius 등 음원·가사 수집 사실 드러나 (2026.7.15)

DB · AIID · ⚖️🔒🚨

해커가 유출한 자료에 따르면 Suno는 YouTube Music, Deezer, Genius와 Pond5·Jamendo·Freesound·IMSLP 등에서 수백만 개의 음원과 가사를 수집해 학습 데이터로 사용했다. 자료에는 YouTube Music 음원 201만 개와 여러 출처에서 수십만 시간에 달하는 데이터셋을 구축한 정황이 포함됐다. 해커는 또한 수십만 명의 이용자 정보와 Stripe 결제 정보에 접근했다고 주장했으며, 이번 자료는 저작권 침해 소송에서 쟁점이 된 Suno의 학습 데이터 수집 방식을 구체적으로 보여준다.

DB

출처: Hacker News

요약불가

🇺🇸 OpenAI Introduces GPT-Red for Automated AI Safety Testing (2026.7.15)

DB · AI-Risk-Explorer · 🚀

Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation (2026.7.15)

연구

대형 audio-language model을 음성 평가 자동 judge로 쓸 때, 사람이 듣고 매긴 근거가 아니라 평가 프로토콜이 제공하는 레이블·참조 데이터 등에 기대 “shortcuts”를 쓸 수 있음을 감사(audit)한다. 세 가지 배포 프로토콜(특징을 구조화 텍스트로 대체하는 feature-blueprint judging, reference-conditioned judging, 쌍별 A/B 비교)을 대상으로 6개 judge와 4개 속성에서 프로토콜 수준 단서가 판정을 좌우하는지 점검한다. feature-blueprint judging에서는 잘못된 specialist labels가 emotion accuracy를 5개 judge에서 0.10 이하로 낮췄고, concatenated A/B comparisons에서는 Qwen3-Omni-Thinking이 order swaps(자리 바꿈)에도 종종 같은 슬롯을 선택하는 패턴이 관찰되었다. 또한 refusal는 거절 판정, complied는 과제 수행, unclear은 빈 출력/오언어 등 명확하지 않은 판정을 뜻하며, 판정 신뢰를 단독 모델 성능만으로는 과대평가할 수 있어 모델-프로토콜을 함께, 매칭된 shortcut probe로 각각 평가해야 한다.

SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing (**2026.7.15**)

연구 · 🔓

LLM agent의 tool call이 실제 피해로 이어질 수 있는 상황에서, 제안된 조치를 단순 safe/unsafe로 이분화하지 않고 사용자 맥락을 함께 고려하는 개입 결정을 제안한다. Safety Sentry는 각 action instance마다 {EXECUTE, ASK, REFUSE} 3-way 라우팅을 수행하며, 구현은 경량 guard model을 사용해 추론이 단일 decoding call로 귀결되도록 설계된다. 단일 decoding-time threshold로 한 체크포인트를 다양한 위험 허용도에 재배치할 수 있고, Safety Sentry는 여러 오픈웨이트 및 프론티어 closed-source 기준선 대비 전반 정확도와 safety-related recall에서 더 높으며, 동시에 directional error rate 양쪽을 함께 제어한다.

요약불가

The Test Oracle Problem in Synthetic LLM-as-Judge Corpora: Disappearance, Distortion and a Validation Protocol (2026.7.15)

연구

합성 LLM-as-judge 코퍼스에서 LLM 생성 단계의 “조용한 실패”가 편향 측정 자체를 구조적으로 왜곡할 수 있음을 보여준다. Turkish/English 이중언어 faithfulness-judgment 코퍼스에서, judging과 generation 호출 간에 공유된 decoding-budget 파라미터가 한 생성자의 hallucinated answer를 수 단어로 잘라 truncation했으며, 그 결과 오류가 코퍼스 항목 무결성(item integrity) 검증 없이 통과되는 문제를 분석한다. 한 judge의 selection accuracy에서 cross-lingual collapse가 32-point 발생했는데 N=50에서 N=500까지 재현되었고, 원인 설명(3-layer mechanistic account)과 producer-swap 실험으로 확인했으나 실제 원인 요인은 아니었다; 공유 파라미터를 수정하자 해당 효과는 ceiling로 소거되었다. 또한 Markdown-formatting preference 편향은 “fabricated”는 아니었지만 같은 fault로 왜곡되었으며, 자극 길이에 따라 한 케이스에서 magnitude와 sign이 변했고, aggregate metrics로는 첫 효과와 구분되지 않았다.

CAVA: Canonical Action Verification and Attestation for Runtime Governance of Agentic AI Systems (2026.7.15)

연구 · 🤖

에이전틱 AI의 다양한 런타임 기록(코딩 훅, SDK 도구, 브라우저 자동화, 워크플로 엔진 등)에서 “어떤 행동이 승인되었고, 독립 검증자가 나중에 같은 행동 정체성을 재현할 수 있는가”를 다루는 런타임 거버넌스 계층을 제안한다. CAVA는 이질적 런타임 활동을 캐노니컬 runtime action object로 변환하기 위해 canonical action identity, semantic pattern detection, approval binding, receipt integrity, runtime-portable projection, optional attestation을 형식화한다. 96-seed, 384-variant 벤치마크에서 semantic equivalence, semantic separation, wrapper bypass, false-positive control, approval binding, receipt reproducibility, attestation tamper detection, runtime portability, policy degradation, Azure deployment drills를 평가하지만, 본문 인용 정량 수치(점수/비율/구간)는 제공되지 않는다.

요약불가