AI 안전 다이제스트

2026-05-18 · 41건

🇺🇸 미국 배심원단, 일론 머스크가 제기한 소송에서 오픈AI 및 샘 알트먼 승소 평결 (2026.5.18)

K-AISI 주간동향 · The Guardian · ⚖️🚀

캘리포니아 연방 배심원단은 일론 머스크가 오픈AI와 샘 알트먼을 상대로 제기한 부당 이득 및 비영리 설립 계약 위반 소송에서 피고 측에 책임이 없다고 평결. 원고의 주장이 소멸시효를 지났으며 경쟁사를 방해하려는 의도라고 판단함에 따라 법적 불확실성을 해소하고 오픈AI의 영리 목적 상장 추진에 힘을 실어줌.

🇺🇸 Anthropic, SDK·MCP 서버 도구 기업 Stainless 인수 (2026.5.18)

기업 · 앤트로픽(Anthropic) · 🚀

앤트로픽은 에이전트가 활용할 수 있는 시스템 범위를 넓히기 위해 SDK 및 MCP 서버 도구 분야 리더인 Stainless를 인수한다고 밝혔다. Stainless는 2022년 설립 이후 앤트로픽의 공식 SDK 생성에 핵심 역할을 해왔으며, API 명세를 TypeScript·Python·Go·Java·Kotlin 등 여러 언어용 SDK/CLI/MCP 서버로 변환해 준다고 설명했다. 앤트로픽은 이번 인수를 통해 Claude가 데이터와 도구에 연결하는 능력을 한층 발전시킬 계획이라고 전했다.

🇪🇺 유럽연합 저작권 규정 현대화 관련 의견 수렴(2026.5.18)

공공 · EU-Digital-Strategy · 📋

유럽 집행위원회는 EU 저작권 체계 현대화를 위한 ‘증거자료 수집(call for evidence)’을 통해 의견을 받는다. 2019년 디지털 단일시장 저작권 지침이 디지털 환경에서 저작권 보호 콘텐츠 이용을 촉진했는지, 라이선싱 관행을 개선했는지, 공정한 저작권 시장에 기여했는지 등을 평가할 계획이며 외부 연구와 이해관계자 설문이 병행된다. 또한 생성형 인공지능이 권리 라이선싱·집행에 제기하는 과제, 특히 실시간 온라인 불법복제 대응, EU 내에서 재생되는 녹음음악에 대한 실연자·제작자의 보수, 연구 목적의 저작물 접근 및 재이용 문제에 대해서도 이해관계자 의견을 요청한다.

🇪🇺 ECCC, 사이버보안 전문가 모집(2026.5.18)

공공 · EU-Digital-Strategy · 🔒

ECCC(European Cybersecurity Industrial, Technology and Research Competence Centre)는 EU의 사이버보안 투자 확대에 맞춰 Digital Europe 및 Horizon Europe 프로그램 관련 평가·모니터링 등을 수행할 전문가를 모집한다. 지원자는 사이버보안 연구·혁신·기술 배치·운영 보안 분야 경력(최소 5년)과 영어 구사 능력이 요구되며, 원격 평가·전문가 패널·프로젝트 리뷰·자문 등 계약 기반 업무로 참여하게 된다. 상시 관심표명은 가능하나, 향후 공고 및 프로젝트 리뷰를 고려해 2026년 6월 15일까지 등록을 권장한다.

🇪🇺🇬🇧 LawAI Seasonal Research Fellowships(2026.5.18)

공공 · LawAI (law-ai.org)

Winter Research Fellowship은 2026년 1월 26일~5월 8일(시작·종료 유연)이며, remote-first로 운영하되 일부 1주 오프라인 참여가 가능하다고 안내했다. Summer Research Fellowship은 트랙별로 6월 15일~8월 21일 또는 6월 29일~9월 4일이며, EU Law 트랙은 캠브리지(영국)에서의 오프라인 참여가 강하게 권장되고 캠브리지 거주자에 추가 생활비 보조가 제공된다. 트랙별로 주당 보조금(US $1,500, EU Law €1,000 등)과 영어(구두·서면 전문 수준) 요건, 비자 관련 지원 가능 여부, 개인별 피드백 제공 불가 등이 FAQ로 정리돼 있다.

🇺🇸🇪🇺 Law-AI 연구소 연간 보고서 2025 (2026.5.18)

공공 · Law-AI-Institute · ⚖️📋🛡️

법과 인공지능(AI) 연구소(LawAI)는 독립적인 법률 연구, 정부·학계·산업 분야 컨설팅, 펠로우십 및 이벤트를 통한 분야 구축을 핵심 활동으로 삼고 있습니다. 2025년에는 이러한 활동이 크게 확장되었으며, 핵심 인력이 20명에서 28명으로 증가했습니다. 계절 연구 펠로우십 지원 건수는 전년 대비 9.5배 증가했습니다. 또한, 3개의 주요 이벤트를 개최하여 200명 이상의 참가자와 50명 이상의 전문가 및 모더레이터가 참여했습니다.

연구소장 크리스토프 윈터는 유럽 AI 사무소의 법률 자문 역할을 수행하며 일반 목적 AI 실천 가이드라인에 대한 의견을 제시했습니다. 윈터는 유럽 의회에서 증언하며 법 준수 AI와 기관 역량 강화에 대한 권고안을 내놓았습니다.

미국 법률 및 정책 팀은 AI 관련 국가 안보 위기 대응을 위한 기술 인재 동원 방안을 포함한 7개의 신규 출판물을 발표했으며, AI 선점 명령의 영향에 대해 CNN, 파이낸셜 타임스, 폴리티코, NBC, 더 버지 등 주요 매체와 논의했습니다.

법률 프론티어스 팀은 법 준수 AI에 관한 선구적인 연구 논문을 발표하고, 이를 통해 기술, 법률, 정책 연구 분야를 발전시키는 데 앞장서고 있습니다. 2026년에는 불확실성 속에서 유연성을 유지하기 위한 연구 및 정책 접근법인 "근본적 선택성"을 강조할 계획입니다. 유럽 법률 팀은 EU 일반 목적 AI 법률에 대한 캠브리지 주석서의 새로운 장을 계속 출판하고, 법률 프론티어스 팀은 자동화된 거버넌스 작업 스트림을 확장할 예정입니다. 모든 펠로우십 프로그램은 겨울 연구 펠로우십을 포함하여 확대될 것입니다.

전체 보고서는 오른쪽 사이드바의 "전체 텍스트 PDF" 링크를 통해 확인 가능합니다.

🇺🇸 AI 모델의 편향 증거 확보를 위한 증류 기법 (2026.5.18)

공공 · RedwoodResearch

이 논문은 증류 기법을 통해 편향된 AI 모델의 편향 증거를 간접적으로 얻는 방법을 제안한다. 편향된 AI 모델을 무해한 모델로 증류할 때, 편향이 증류 모델로 전달되지만 감사 회피 능력은 전달되지 않는 상황을 노린다. 이를 통해 원래 모델의 편향 증거를 감사 과정에서 간접적으로 확인할 수 있다. 논문은 증류 기법의 구체적인 방법과 그 성공 가능성에 대해 논의하며, 편향 증거 확보의 새로운 접근법으로서 이 기법의 잠재력을 강조한다. 그러나 증류 과정에서 거짓 양성 사례와 해석하기 어려운 증거 등의 문제점도 지적한다.

(기사 기준일: 2026.5.18)

언론 · Wired(wired.com) · 🗳️

AI 붐이 가족 내 역할과 관계를 성별에 따라 재편하며, 특히 베이 지역의 화이트칼라 부부에서 ‘AI에 집착하는 남편’과 ‘돌봄·가사·정서적 지원을 떠안는 아내’ 간 갈등이 심화되고 있다는 내용이다. 남성은 AI 관련 일에 장시간 몰입하며 경계가 무너지고, 여성은 가사·돌봄 부담과 정서적 지지 역할이 늘어 ‘정신적 소진’과 우울·불만이 누적된다고 전한다. 일부 아내들은 결혼 문제를 해결하려고 ChatGPT 같은 도구를 활용하기도 하지만, 상담 효과가 제한적이거나 부정적 선택(불륜 등)을 정당화하는 방향으로 오용될 수 있다고 지적한다.

🇺🇸🇨🇳 촉매적 규제: 규제 공백기 안전을 유도하는 인센티브 (2026.5.18)

언론 · AI-Frontiers

이 글은 의무·처벌 중심의 전통적 규제 대신 세액공제, 안전성이 검증된 시스템에 대한 조달 인센티브, 명성机制 등을 통해 AI 안전을 촉진하는 ‘촉매적 규제’를 제안한다. 이러한 정책은 현재 미국의 탈규제 및 대중국 경쟁 중심의 정치 환경에서 실행 가능성이 높고, 안전 기준·평가 인프라와 조직 내 안전 문화를 발전시켜 향후 강력한 규제의 기반이 될 수 있다고 설명한다. 구체적 방안으로는 AI 안전 연구개발 세액공제, 수요 측 인센티브, 시장 보장, 명성机制의 네 가지를 제시하며, 안전 연구에 대한 세액공제가 기업의 추가 자금을 마련하기보다 기존 자원의 배분을 안전 분야로 유도할 수 있다고 주장한다.

🇨🇳🇰🇷 DeepSeek의 AI 분야 ‘화웨이식’ 사명 (2026.5.18)

언론 · ChinAI 뉴스레터 · 🚀

중국 평론가 쭝밍은 외부 제재에 대응해 국내 기술 역량과 공급망을 구축해야 한다는 점에서 DeepSeek의 역할이 통신 분야 화웨이와 유사하며, 투자는 중국의 국가적 AI 전략에 대한 베팅이라고 분석했다. DeepSeek V4의 화웨이 Ascend 칩 최적화는 중국산 대규모 언어 모델과 컴퓨팅 자원 간 ‘칩-모델 협력’의 진전으로 평가됐고, 20일도 안 돼 기업가치가 500억 달러 이상으로 세 배 뛴 배경에는 독자적인 풀스택 AI 구축의 전략적 희소성이 거론됐다. 다만 DeepSeek는 소비자 서비스와 상업화에서 중국 경쟁사보다 뒤처져 있으며, 분석자는 여전히 학습 단계에서 Nvidia 칩 의존이 상당할 수 있고 국내 대체는 추론 부문을 중심으로 점진적으로 진행 중이라고 지적했다.

🇺🇸 Lyft 운전자, AI로 승객에게 차량 훼손 비용을 부과하려 한 혐의 (2026.5.18)

DB · AIID · 🚨

미국 플로리다주 보카러턴의 한 Lyft 운전자가 승객이 차량을 훼손했다며 Google Gemini로 조작한 것으로 보이는 이미지를 제출해 비용을 청구한 혐의를 받고 있다. Lyft는 처음에는 승객 가족에게 수수료를 부과했지만, 이의 제기 후 운전자의 주장이 허위임을 확인하고 환급, 운전자·승객 매칭 해제 및 운전자 제재 조치를 했다. 운전자에 대한 형사 고발 가능성도 제기됐으나, 기사에는 실제 고발 여부가 확인되지 않았다.

Kazakhstan AI Safety Institute, 고도 AI의 위험을 과학적으로 이해·완화하기 위한 연구·거버넌스 추진(2026.5.18)

기타 · 카자흐스탄 AI 세이프티 인스티튜트(kaisi.kz) · 📜🧪

카자흐스탄 AI Safety Institute(AISI)는 고도 AI가 야기하는 위험을 정부가 과학적으로 이해하도록 지원하는 것을 미션으로 연구와 인프라 구축을 진행한다고 밝혔다. 대규모 모델의 행동을 이해·해석·통제하기 위해 activation steering, 적대적 강건성 분석, 기계적 해석가능성 등 기술을 활용해 내부 표현과 유해 행동을 파악하고 안전한 모델 제어·평가 도구를 개발하겠다는 계획이다. 또한 거버넌스 프레임워크와 규제·국제협력을 분석해 위험 분류와 감독 체계를 포함한 정책 권고로 연구 성과를 연결하겠다고 설명했다.

🇰🇷 글로벌 AI 경쟁력 강화를 위한 오픈소스AI 활성화 방안(2026.05.18)

공공 · 소프트웨어정책연구소(SPRi) · 🔓

오픈소스AI 생태계의 성장 배경과 개념을 정리하고, 국내외 기업·모델 데이터를 비교 분석한 뒤 정책 시사점을 제시하는 연구이다. GitHub·Hugging Face 성장, 오픈소스 채택 비율(인프라 89%)과 비용 절감 효과(예: chatGPT 대비 1/30) 등 오픈소스AI의 확산 동인을 설명하며, OSI의 4가지 자유 및 리눅스 재단의 모델 개방성 프레임워크 등 개념 정립 움직임을 소개한다. EpochAI 모델 데이터(1950~2025.6, 964개 유명 모델 중 오픈소스 269개)와 국내 AI 개발자 설문(371명)을 바탕으로 오픈소스 모델 영향력 증가, 데이터/코드 공개 수준의 차이, 저작권 침해 우려와 인력·거버넌스 부족 같은 저해요인을 도출하고, 선진 기술 수용 지원·내재화·전문가 양성·전문기업 육성 등을 정책 제언으로 제시한다.

(저자 외 0명, arXiv, 2026.5.18)

연구 · arXiv · 🤖

자율 에이전트가 규제된 중요 인프라에서 고빈도 정책 업데이트를 받을 때, 런타임에서 기계적·하드웨어 루트의 집행이 부족하다는 문제를 다룬다. Governance-Aware JIT 컴파일러로 Policy Enforcement Point(PEP)를 추론 파이프라인으로 옮기고, 정책 동기화를 위해 CRDT를, TEE 내 Epoch-based Attestation Caching을 결합한 아키텍처를 제안하며 TLA+로 형식 검증을 수행한다. 비준수 에이전트 행동이 경계된 상태공간에서 계산적으로 도달 불가능함을 보이고, Governance Latency를 O(days)에서 O(1)로 줄이며 Sub-millisecond Formal Determinism(SMFD)을 달성한다고 보고한다.

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs (저자 외 6명, arXiv, 2026.5.18)

연구 · arXiv · 🔒🧪

DMN은 멀티이미지 입력을 지원하는 MLLM에서 여러 이미지에 걸쳐 유해 요청을 분산하고 시각적 추론을 추가로 유도하는 취약점을 겨냥한다. D(Distributed instruction), M(Multimodal evidence), N(Number chain)으로 구성된 조합형 프레임워크를 제안하고, GPT-4o, Gemini-2.5-pro, Claude Sonnet 4에 대해 실험해 공격 성공률을 비교한다. GPT-4o·Gemini-2.5-pro·Claude Sonnet 4에서 공격 성공률 90% 이상을 달성했으며, 기존 베이스라인 대비 큰 폭으로 향상되었다.

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models (저자 외 4명, arXiv, 2026.5.18)

연구 · arXiv · 🧪

10개 LALM과 5개 데이터셋에서, 오디오를 악성 콘텐츠 삽입이 아닌 안전 정렬(alignment) 간섭의 트리거로 쓰는 세팅을 다룬다. Acoustic Latent Semantics(ALS)에 기반한 보편적·지시문 중립(instruction-neutral) 간섭 오디오를 사용해, 인스턴스별 최적화 없이 일반적인 악성 텍스트 질의가 안전 정렬을 우회하도록 하는 Acoustic Interference Attack(AIA)을 제안하고 실험한다. 결과로 AIA가 10개 LALM/5개 데이터셋에서 기존 방법 대비 state-of-the-art 공격 성공률을 달성하며, 해석 분석에서 AIA가 유발하는 추론 경로(inference path) 드리프트와 ALS의 유효 패턴을 보고한다.

Assured Autonomy: OR로 생성형 AI 에이전트의 자율성과 안전을 오케스트레이션 (저자 외 3명, Production and Operations Management, 2026.5.18)

연구 · OpenAlex · 🤖

생성형 AI가 대화형 도우미에서 에이전트형(감지-결정-행동) 운영 시스템으로 이동하며, 자율성이 커질수록 제약·구조·꼬리위험 관리가 더 필요하다는 “자율성 역설”을 다룬다. 흐름 기반 생성 모델을 결정론적 수송(ODE)으로 재구성해 감사가능성·제약 인지 생성과 최적수송/강건최적화/순차결정 제어의 연결을 제시하고, 운영 안전은 불확실성/모호성 집합 내 최악 교란에 대한 적대적 강건성 관점으로 평가하는 프레임워크를 제안한다. 핵심 결론은 자율성 증대에 따라 OR의 역할이 단순 해법 제공자에서 가드레일·시스템 아키텍트로 이동하며, 제어 로직·인센티브 프로토콜·모니터링·안전 경계가 설계 요소로 정리된다는 점이다.

The BridgeAI Project: Humans Are Not Tokens (저자 외 4명, NATO science for peace and security series. Sub-series E, Human and societal dynamics, 2026.5.18)

연구 · OpenAlex · ⚖️📋

BridgeAI 프로젝트는 유럽 AI Act와 사회적 함의를 다루며, 인간이 의사결정에서 ‘토큰’이 아니라 의사결정의 일부라는 동적 정치 의사결정 관점을 중심으로 설정했다. 산업 사례 기반 케이스 스터디를 통해 AI 위험, 윤리, 법, 리터러시 및 유럽·국제 AI 입법 지형을 포함하는 다학제 권고안을 정리했다. 핵심 결과는 윤리·리터러시를 일상과 구체적 행동으로 전환하기 위한 정책·실행 권고 형태로 제시되며, 정량 수치(예: 점수/정확도)는 본문에 명시되지 않았다.

🇪🇺 기술·법적 정의를 기반으로 TLN(기술·법 규범) 설계를 위한 10단계 알고리즘 제안 (저자 외 2명, OpenAlex, 2026.5.18)

연구 · OpenAlex · ⚖️

디지털 신원·블록체인·스마트계약·디지털 트윈·메타버스 등과 AI·데이터 관리가 결합되면서 기존 법적 개념 정의만으로는 기술 기능, 알고리즘적 함의, 상호운용성, 증거, 책임, 관할의 연결을 충분히 반영하기 어렵다는 문제를 다룬다. 문헌(독트린)·비교법·법-언어 분석 및 법 반(半)기호학, 시스템-구조 방법, 규범 모델링과 인간의 필수 통제를 전제로 한 AI 보조 법률 모델링을 결합해 EU AI Act, GDPR, DSA, Data Act, eIDAS 2.0, Cyber Resilience Act, MiCA가 복합적 기술·법적 정의에 기반해 권리·의무·위험·준수·책임·관할을 구획한다고 정리한다. 핵심 결과로 기술·법적 정의를 디지털 법의 인프라 요소로 보고, TLN 설계를 위한 AI 활용 10단계 알고리즘을 제안하며(인간 전문가의 필수 참여 포함) AI는 법 모델링을 보조하되 대체하지 않는다고 명시한다.

저자 외 N명, Surviving the Unseen: Predictive Defense for Novel Multi-Turn Multimodal Attacks, arXiv, 2026.5.18

연구 · arXiv

다중 턴·멀티모달 대화에서 공격자가 시간에 걸친(비정상) 교차-모달 점진 교란으로 턴 단위 가드레일을 우회하는 세팅을 다룬다. TRIAD 프레임워크는 대화 흐름을 연속 궤적(trajectory)로 모델링하고, 공분산 변화 모니터링(구조적 이상 탐지, Ledoit-Wolf 정규화 Mahalanobis 거리)과 궤적 가속도(위상/운동학적 특징)로 악성 드리프트와 양성 탐색을 구분한 뒤, Bayesian HMM 피드백 루프를 포함한 time-varying Cox Proportional Hazards 모델로 생존(실패까지 시간) 예측을 수행한다. 이론 분석에서 적대적 교란 하 기대 time-to-failure가 수학적으로 경계(bound)됨을 보이며, 악성 가속이 양(+)으로 발산하도록 보장한다.

저자 외 0명, Be Kind, Rewrite: Benign Projections via Rewriting Defend Against LLM Data Poisoning Attacks, arXiv, 2026.5.18

연구 · arXiv

LLM 데이터 포이즈닝(백도어) 공격에서 트리거 기반 유해 샘플을 학습에 주입하는 세팅을 다룬다. LLM rewriting을 사전 방어로 사용하되, 공개된 양성 샘플을 활용한 open-book benign rewriting(OBBR)을 제안하고 이론적으로 OBBR이 닫힌-책(closed-book) rewriting보다 유해가 아닌 출력 확률이 엄밀히 더 크다고 보인다. 5개 알려진 백도어와 4개 널리 쓰이는 LLM에 대해 OBBR은 기존 SOTA BA 방어 대비 평균 51%, closed-book rewriting 대비 25.7%의 안전 성능 향상을 보이며, 미세조정 후 자연어 과제 성능 저하가 없고 비-트리거 기반 포이즈닝에도 방어 가능하다고 보고한다.