AI 안전 다이제스트

2026-04-10 · 16건

🇬🇧 Infusion, influence functions로 훈련데이터를 미세 수정해 모델 행동을 유도 (2026.04.10)

공공 · AISI-UK · 🔬

Infusion은 영향함수 기반 근사로 훈련 문서에 작은 섭동을 가해 파라미터 변화를 통해 목표 행동의 변화를 유도하는 프레임워크다. CIFAR-10에서는 학습데이터 0.2%(45,000개 중 100개)만 미세 편집해도 소수의 명시적 행동 예시를 삽입하는 기준선과 경쟁력 있는 성능을 보였고, ResNet 등 서로 다른 아키텍처 간에도 전이가 나타났다. 언어 실험에서는 목표 행동의 확률을 높이는 경우와 실패하는 조건을 함께 분석했으며, 대체로 모델이 이미 학습한 행동을 증폭하는 데 가장 효과적이라고 밝혔다.

🇬🇧 영국 AISI, 훈련 데이터 편집을 통해 AI 모델의 행동을 조작하는 'Infusion' 프레임워크 공개 (2026.4.10)

K-AISI 주간동향 · UK AISI

영국 AISI 연구진은 영향 함수(influence functions)를 활용해 소량의 훈련 데이터를 정밀하게 조작함으로써 AI 모델의 행동을 유도하는 'Infusion'을 발표. 전체 데이터의 0.2%만 미세하게 변경해도 타깃 행동을 유발할 수 있으며 이 방식이 다른 아키텍처에도 전이될 수 있음을 시연하여, 훈련 데이터 해석 및 보안의 중요성을 강조.

🇨🇳🇺🇸 중국 주요 은행들, 미국의 앤스로픽 '미토스' 사이버 경고에 대비해 신중한 AI 채택 기조 유지 (2026.4.10)

K-AISI 주간동향 · SCMP · 🔒

미국 재무부가 앤스로픽의 신형 AI 모델 '미토스'로 인한 잠재적 사이버 위협에 대해 긴급 회의를 소집한 가운데, 중국 국유 은행들은 금융 안정을 최우선시하며 신중한 입장을 고수. 중국 당국은 미국 내 사이버 리스크 전이를 면밀히 모니터링하며, 치명적인 취약점 노출 위험을 사전에 막기 위해 핵심 뱅킹 시스템에 AI를 성급하게 전면 도입하는 것을 유보.

캐나다 AI 담당 장관, 챗봇 악용 사건 관련 OpenAI의 안전 프로토콜 검토 착수 발표 (2026.4.10)

K-AISI 주간동향 · CTV News · 🧒

※ 단신. 캐나다의 Evan Solomon AI 장관은 밴쿠버에서 발생한 총격범의 챗봇 악용 사태 이후, 캐나다 AI 안전 연구소가 OpenAI의 시스템과 프로토콜에 접근할 수 있게 되었다고 밝힘. Solomon 장관은 OpenAI가 아동 보호 및 고위험 범죄자 식별을 위한 새로운 안전 조치와 함께 사법 당국(RCMP)과의 직접적 연락망 구축 등을 약속했다고 발언.

🇨🇳 중국 5개 부처, 'AI 의인화 상호작용 서비스 관리 잠정 조치' 발표 (2026.4.10)

K-AISI 주간동향 · 新华网 · 🧒

중국 국가망신판 등 5개 정부 부처는 AI의 감정적 상호작용 서비스가 사용자에게 미치는 부정적 영향을 막기 위해 새로운 규제 조치를 공동 발표. 26년 7월 시행되는 이 규정은 미성년자에게 유해한 콘텐츠 생성을 금지하고, 사용자의 감정적 의존 유도나 불합리한 의사결정을 조장하는 행위를 엄격히 규제.

🇺🇸 OpenAI, 'Axios' 침해 사고에 따른 조치 공지 (2026.4.10)

K-AISI 주간동향 · OpenAI · 🔒🚀

OpenAI는 Axios 라이브러리의 공급망 공격 과정에서 macOS 앱 서명 워크플로우가 노출될 위험이 감지됨에 따라, 선제적으로 보안 인증서를 교체하고 업데이트를 안내했다고 밝힘. 사용자 데이터 유출 등 실제 피해는 없으나 안전을 위해 구형 앱 버전의 지원을 중단하며, 사용자는 새로운 인증서가 적용된 최신 버전으로 업데이트하라고 권고.

🇺🇸 OpenAI Safety Fellowship 소개 (2026.4.10)

기업 · 오픈AI(openai.com) · 🚀

본문 내용 확인 필요. 현재 제공된 정보(제목·URL·출처)만으로는 프로그램의 구체 내용(대상, 기간, 선발 방식, 주요 활동 등)을 확정해 요약할 수 없습니다. 세부 사항은 페이지 본문 확인 후 정리 필요합니다.

AI 거버넌스 역량을 ‘실무자 역량’과 ‘조직의 수용능력’으로 진단하는 프레임워크 소개 (2026.4.10)

기업 · governance.aicareer.pro

AI 거버넌스 역량을 스스로 과대평가하거나(일명 Dunning-Kruger 효과) 인증·컴플라이언스 중심으로 접근해 실제 운영 능력을 놓치는 문제를 짚는다. 글은 거버넌스가 단일 능력이 아니라 서로 맞물려 성장하는 여러 ‘역량’이며, 어디가 약한지 파악해야 다음 조치를 정할 수 있다고 설명한다. 이를 위해 실무자 역량(지식·적용 등 5개 차원)과 조직 역량(구조·전략·운영 기반)을 각각 측정하는 2가지 평가 도구로 구성된 진단 프레임워크를 제시한다.

🇪🇺 개정 ‘불법 혐오표현 온라인 대응 행동강령(Code of Conduct+)’ 첫 모니터링 결과 공개 (2026.4.10)

공공 · EU-Digital-Strategy · 📋

개정된 Code of Conduct+의 첫 모니터링 결과가 공개됐으며, 서명 사업자 데이터와 독립 모니터링 보고자 데이터가 함께 포함됐다. 모니터링은 플랫폼이 불법 혐오표현으로 의심되는 신고에 얼마나 신속히 대응하는지와, 서명 플랫폼이 자사 서비스에서 혐오 콘텐츠를 어떻게 다루는지에 대한 자체평가를 결합해 평가했다. 대부분의 플랫폼은 24시간 내 다수 신고를 검토하고 전반적으로 체계적 피드백을 제공한 것으로 나타났으나, X를 제외한 모든 서명자는 상당 비율의 사례가 분쟁되거나 오류로 분류됐다고 평가했으며, 일부 오류는 모니터링 보고자가 사용한 신고 채널의 부적절 때문일 수 있다고 설명했다. 또한 위원회는 결과 공개를 통해 책임성과 투명성을 높이고, 2026년 모니터링 준비 과정에서 격차를 식별·보완하도록 서명자와 이해관계자 참여를 요청했다.

🇪🇺🇺🇸 재단(파운데이션) 모델의 개인정보 침해 위험과 거버넌스 필요성(2026.4.10)

공공 · 스탠퍼드 HAI(Stanford HAI) · 🧪

재단 모델은 기존 AI보다 더 광범위하고 아직 충분히 다뤄지지 않은 개인정보 위험을 개인과 사회에 동시에 초래한다고 지적한다. 학습 단계의 대규모 개인정보 수집, 출력에서의 민감정보 기억·재현, 챗봇 인터페이스를 통한 사용자의 무의식적 정보 노출 전 과정에서 위험이 발생하며, 프롬프트 인젝션·데이터 포이즈닝·모델 인버전 같은 공격으로 프라이버시 보호가 우회될 수 있다. 현행 프레임워크(GDPR 등)는 재단 모델의 구축 방식과 근본적으로 맞지 않지만, EU와 미국 모두 개발자 행동을 실질적으로 바꿀 포괄적 규칙이 부족하므로 정책은 학습 데이터 파이프라인에서 개인데이터 제거, 프라이버시-바이-디자인, 투명성·해석가능성 강화, 출력 제약 등을 포함한 거버넌스를 검토해야 한다.

🇺🇸 MirrorCode: AI의 주간 코딩 작업 수행 능력 입증 (2026.4.10)

공공 · METR

METR가 자금 지원 및 공동 개발한 MirrorCode 프로젝트의 초기 결과를 발표합니다. 이 프로젝트는 AI가 몇 주 동안 지속되는 코딩 작업을 수행할 수 있음을 입증하는데 초점을 맞추고 있습니다. 자세한 내용은 Epoch AI의 블로그 포스트를 참조하세요. METR는 경계 AI 시스템의 복잡한 자율 작업 수행 능력을 측정하기 위해 연구, 개발 및 평가를 진행하고 있습니다.

FLI 최고경영자, 샘 올트먼 자택 공격 규탄 성명 발표 (2026.4.10)

공공 · 생명의 미래 연구소(FLI) · 🗳️

생명의 미래 연구소의 앤서니 아기레 회장 겸 최고경영자는 샘 올트먼의 자택 공격으로 다친 사람이 없어 다행이라며 올트먼과 가족, 피해를 입은 모든 이들에게 위로를 전했다. 그는 이번 사건을 비열하고 정당화할 수 없는 행위로 강력히 규탄하고, 법 집행기관이 책임자를 법에 따라 엄중히 처벌해야 한다고 촉구했다. 또한 AI의 미래를 둘러싼 논의에서 어떤 형태의 폭력과 협박도 용납될 수 없다고 밝혔다.

Partnership on AI Partner Forum 2025(2026.4.10)

공공 · Partnership on AI · 📜📋🤖

Partnership on AI는 2025년 10월 21일 샌프란시스코에서 Partner Forum 2025를 개최한다고 밝혔다. 행사에서는 AI agents 관련 AI safety 모범사례를 신기술에 어떻게 적용할지, AI가 일자리와 미래 노동에 미치는 영향이 순기능이 되도록 어떻게 설계할지, 기관에 대한 낮은 신뢰 속에서 responsible AI를 어떻게 지속 발전시킬지 등을 논의한다. AI & Trust, Future of Work, responsible AI frameworks, AI agents의 guardrails 등 패널·대화·라이트닝 토크와 네트워킹 프로그램이 포함되며 Dean Ball, Miranda Bogen, Reena Jana, Nicol Turner Lee 등 여러 연사가 참여한다.

AI가 원본 소스코드 없이도 장기(수주) 코딩 과제를 재구현할 수 있다는 MirrorCode 예비 결과(2026.4.10)

DB · Epoch AI

MirrorCode는 실제 소프트웨어에서 유래한 장기 CLI 코딩 과제를 벤치마크로 구성해, AI가 원본 소스코드 없이도 실행(Execute-only)과 테스트 케이스를 바탕으로 동일한 출력을 내는지 평가한다. Claude Opus 4.6은 choose, cal, gotree 등 여러 프로그램을 성공적으로 재구현했으며, gotree는 40개 명령을 포함한 복잡한 생물정보 도구로 제시된다. 다만 Pkl은 아직 미해결이며, 토큰 예산을 늘리면 성능이 계속 개선될 가능성이 있다고 설명한다. 또한 원본 코드 규모(LoC)가 클수록 성능이 낮아지는 경향과, 추론 토큰을 더 쓰면 더 나은 진행이 가능하다는 관찰을 함께 제시한다.

🇰🇷

공공

출처: 소프트웨어정책연구소(SPRi)

본 보고서는 2026년 전 세계 AI 지출이 2.5조 달러에 이를 전망이며, 그중 절반 이상이 서버·가속기·데이터센터 등 인프라에 집중된다고 설명한다. NVIDIA GPU 지배력은 하드웨어 성능뿐 아니라 CUDA 이후 축적된 소프트웨어 생태계와 최적화 격차로 인해 동일 칩에서도 처리량이 3배 이상 달라질 수 있다고 분석한다. AI 소프트웨어 스택을 프레임워크·컴파일러·가속 라이브러리·드라이버/런타임 4계층으로 나누고, 성능 종속·설계 종속·구조적 종속 등 3가지 잠금 메커니즘이 중첩될수록 전환비용이 커진다고 제시한다. 이를 K-NPU에 적용하면 프레임워크 진입은 이뤘지만 컴파일러·라이브러리 성능 격차 해소와 운영 생태계 규모 확보가 과제로 남아 있으며, 이를 위해 SW 생태계 R&D 확대, 글로벌 오픈소스 표준 참여, 공공 실증환경 제공, TCO 기반 평가, 전문 인력 양성을 제언한다.