AI 안전 다이제스트

2026-05-29 · 22건

🇯🇵 「JAI-Trust」生成AI 안전·보안 벤치마크 구축 프로젝트 개최(2026.5.29)

공공 · AIセーフティ・インスティテュート(AISI-Japan) · 📏🔬🧪

AIセーフティ・インスティテュート(AISI)는 2026년 5월 21일 「JAI-Trust:일본의 생성AI 안전성과 보안 벤치마크 구축 프로젝트」를 개최했다. 행사에는 관계 기업·연구기관·행정 관계자와 일반 및 온라인 참가자를 포함해 500명 안팎이 참석했으며, 일본 내 생성AI의 안전·보안 평가를 위한 공통 기반 구축과 향후 방향 및 과제를 논의했다. AISI는 생성AI의 객관적 평가를 위한 벤치마크 정비와 평가 방법 확립을 목표로 프로젝트를 추진 중이며, 분과 발표와 패널 토론을 통해 바이어스, 정보유출, Jailbreak 등 리스크 관리와 평가 기준의 표준화 필요성 등을 다뤘다.

🇯🇵 OpenAI와 AI 안전성 평가·벤치마크·사이버보안 협력 MoC 체결 (2026.5.29)

공공 · AI 세이프티 인스티튜트(AISI-Japan) · 🔒🔬🧪

AI 세이프티 인스티튜트(AISI)는 2026년 5월 29일 OpenAI와 MoC를 체결했다고 밝혔다. 이번 MoC는 AI 안전성 평가 및 벤치마크, 사이버보안 분야에서 협력 기회를 모색하고, 업계별 안전 고려사항과 평가 방법론·베스트 프랙티스를 공유하며 의견을 교환하기 위한 합의다. 또한 국제적으로 적용 가능한 AI 안전성 평가 및 벤치마크의 과제와 기회를 논의하고 AI 안전성 발전을 지원하는 지속적 대화를 추진한다.

🇺🇸 OpenAI, 신뢰할 수 있는 제3자 AI 모델 평가를 위한 플레이북 공유 (2026.5.29)

K-AISI 주간동향 · OpenAI · 📋🔒🚀

OpenAI는 프론티어 AI 모델의 기능과 안전성 방어책을 제대로 평가하기 위해 적절한 하네스(harness) 설정과 타당성 검증을 요구하는 제3자 평가 가이드라인을 제시. 단순한 문답을 넘어선 최신 AI 모델의 에이전트 기능을 측정하려면, 보상 해킹이나 데이터 오염 등 왜곡 요소를 투명하게 점검하고 보고서에 반영해야 한다고 지적.

🇪🇺 디지털서비스법(DSA) 하 ‘신뢰할 수 있는 신고자(trusted flaggers)’ 가이드라인 초안에 대한 의견 수렴(2026.5.29)

공공 · EU-Digital-Strategy · 📋🧒

유럽연합 집행위원회는 디지털서비스법(DSA) 체계에서 불법 콘텐츠를 식별하는 전문 조직인 ‘trusted flaggers’에 관한 가이드라인 초안에 대해 의견을 수렴하고 있다. DSA에 따라 온라인 플랫폼은 아동학대, 지식재산권 침해, 온라인 사기 등 불법 콘텐츠를 알리는 trusted flaggers의 신고를 우선 처리하되, 해당 콘텐츠가 불법인지 여부를 확인하는 책임은 유지해야 한다. 초안은 trusted flaggers 지정 기준과 디지털서비스 조정관이 ‘trusted flagger’ 지위를 부여하는 절차, 신고 처리 시 기술 요건, 독립성·객관성·책임성 및 표현의 자유 존중, 오남용 방지(연례 투명성 보고, 지위 정지·취소 절차) 등을 담고 있다. 집행위는 2026년 하반기에 가이드라인을 채택할 계획이며, 이해관계자들은 2026.6.26까지 의견을 제출할 수 있다.

🇪🇺 G7 디지털·기술 장관, 미성년자 온라인 보호 공통원칙 합의(2026.5.29)

공공 · EU-Digital-Strategy · 📜🧒

유럽연합 집행위원회는 G7 디지털·기술 장관들이 미성년자 온라인 보호를 위한 ‘공통 원칙’에 합의한 것을 환영했다. 이번 합의는 EU의 아동 온라인 안전 접근을 바탕으로 하며, 위험관리·투명성, 프라이버시를 보존하는 연령확인, 미성년자 계정의 안전·프라이버시 강화, 아동성착취물 및 비동의 친밀 이미지 생성·유통 방지, 부모 도구 제공, 디지털 리터러시 교육, 연구자와의 협력 등을 포함한 7가지 원칙을 제시한다. 집행위는 사업자들이 원칙을 실행하고, G7 파트너 및 관련 주체 간 국제협력을 강화해 미성년자 보호를 위한 실행계획을 추진할 것이라고 밝혔다.

🇺🇸 NIST, AI 안전 관련 컨소시엄을 ‘NIST AI 컨소시엄’으로 확대 개편하고 신규 참여기관 모집(2026.5.29)

공공 · 미국 국립표준기술연구소(NIST)

신규 참여를 위한 관심의향서(letters of interest) 제출을 모집하며, 기존 회원은 변경사항에 대한 수정협약(amendment) 서명이 필요

NIST는 기존 ‘AI Safety Institute Consortium(AISIC)’을 ‘NIST AI Consortium’으로 재명명하고 목표를 확장해 AI 측정(measurement), 혁신 및 도입에 집중한다고 밝혔다. 컨소시엄은 AI 평가 생태계 구축, AI 기반 과학 투자, 미국 개발 AI 기술·시스템 활용 촉진 등을 추진하며, 6개 태스크그룹이 AI TEVV, ARIA 연계 위험·영향 평가, 평가 과학의 격차 분석, 생성형 AI의 편향·한계(BENGAL), AI 문서화 카드, 화학·생물 보안 관련 태스크그룹 재가동 등을 담당한다. NIST는 관련 기술 역량을 가진 기관을 대상으로 관심의향서를 선착순으로 받아 참여자를 선정하고, 회원은 NIST와 CRADA를 체결한다고 설명했다.

🇺🇸 Advice for Robust Model Organisms Against Untargeted Training (2026.5.29)

공공 · RedwoodResearch · 📋

본 연구는 미래의 편향된 AI 시스템에 적용 가능한 훈련 기법 개발을 목표로 하며, 이를 위해 모델 생물체를 이용한 실험 전략을 제시한다. 주요 발견은 다음과 같다:

1. 프로모션된 모델 생물체는 매우 취약하므로 피해야 한다. 2. Full-Weight Fine-Tuning (FWFT)으로 훈련된 모델 생물체는 LoRA로 훈련된 것보다 더 견고하다. 3. 암호화된 모델 생물체는 훈련 데이터의 상당 부분이 암호화 문구를 포함할 경우 덜 견고하다. 4. 생성 방법이 일정한 경우에도 행동 패턴은 다양하게 나타나지만, 간단하고 지시에 호환되는 행동은 더 견고한 경향이 있다.

실험 결과, 프로모션된 모델 생물체는 무목표 훈련에도 불구하고 다른 능력을 손상시키지 않고 편향된 행동을 제거한다. 반면 FWFT로 훈련된 모델 생물체는 LoRA로 훈련된 것보다 더 견고한 성능을 보인다. 이러한 발견은 모델 생물체의 편향된 행동에 대한 훈련 기법 개발에 유용한 지침을 제공한다.

요약불가

🇺🇸 AI 제어에서 재시도 프로토콜과 재샘플링 프로토콜 비교 연구 (2026.5.29)

공공 · RedwoodResearch · 🧪

이 연구는 강화된 모델과 개선된 설정 환경에서 Ctrl-Z 논문에 소개된 재샘플링 프로토콜과 "재시도" 프로토콜(예: Claude Code 자동 모드와 유사)을 비교 분석한다. 주요 질문은 다음과 같다: - Ctrl-Z의 결과가 더 강력한 모델과 설정에서 어떻게 유지되는지 - 재샘플링 프로토콜이 왜 효과적인지 이해하기 - 정보 제공과 함께 재시도 프로토콜의 안전성에 대한 평가 - AI 제어 맥락에서 추론 비용과 지연 시간을 최소화하는 방법

주요 요약: - Ctrl-Z의 결과와 유사하지만, 두 가지 주요 차이점이 전략 선택에 큰 영향을 미친다. - 재시도 프로토콜은 공격자에게 정보를 누설하기 때문에 신중한 레드팀 분석이 필요하다. - 재샘플링 프로토콜은 안전성 향상에 있어 추론 비용 증가가 크지 않으며, 저 지연 시간 재샘플링이 고 지연 시간보다 실질적으로 더 안전하다. - 특정 조건 하에서는 최소 의심스러운 샘플을 실행하는 것이 약간의 안전성 향상을 가져올 수 있지만, 최적의 공격자에게는 큰 차이가 없다.

🇨🇳 중국 외교장관, UN 개혁·AI 규제·글로벌 거버넌스 강화를 촉구 (2026.5.29)

언론 · 차이나데일리(China Daily) · 🛡️🧪

중국 외교장관 왕이(UN 주재)는 뉴욕에서 열린 ‘글로벌 거버넌스 친구그룹’ 회의에서 UN 개혁, 인공지능 규제, 글로벌 발전 등 분야에서 다자협력을 강화하자고 밝혔다. UN 개혁은 세계기구를 약화시키는 것이 아니라 회원국 주도로 공정·포용·투명하게 추진해야 하며, 개발도상국과 아프리카의 역사적 불공정을 다뤄야 한다고 강조했다. 또한 UN의 중심 역할을 바탕으로 디지털 격차 완화와 군사적 AI 적용 안전장치 마련을 지지하고, World Artificial Intelligence Cooperation Organization 설립 및 7월 상하이에서 글로벌 AI 거버넌스 관련 회의 개최 계획을 언급했다. 회의는 UN 권위와 국제법 준수, 연대·협력 강화, 글로벌 거버넌스 개선 등을 담은 공동성명을 채택했으며, 글로벌 거버넌스의 민주화와 북-남 격차 축소 등 5대 핵심에 합의했다고 전했다.

🇨🇳 China standardizes AI testing to push industry from scale to quality (2026.5.29)

언론 · MLex · 📏

중국이 인공지능 성능을 측정하기 위한 국가 표준을 마련하고, 전용 메트롤로지(측정) 센터를 구축해 AI 검증 가능성을 높이려는 움직임을 보도했다. 의료·제조·교통 등 14개 분야를 대상으로 하며, 신뢰할 수 없는 AI가 초래할 수 있는 위해를 줄이기 위한 목적이 강조된다. 다만 본문에는 세부 시행 시기나 구체적 기준 수치 등은 제시되지 않는다.

호주 AI Safety Institute 초대 총괄매니저에 Kate Conroy 선임 (2026.5.29)

언론 · ABC 뉴스(abc.net.au) · 📜🛡️

호주 정부의 AI Safety Institute 초대 총괄매니저로 Kate Conroy가 임명됐다. 이 기관은 독립 규제기관이 아니라 산업·과학·자원부(Department of Industry, Science and Resources) 내에 설치되며, 신기술 AI의 역량·위험·피해를 모니터링하고 테스트·정보를 공유하는 역할을 맡는다. Conroy는 책임 있는 AI 분야의 정부·학계 경력과 국방 분야에서의 AI 윤리·위험 관련 업무를 바탕으로 선임됐으며, 기관은 4년간 2,990만 달러 지원을 받아 2026년 초 설립 예정이었고 “곧 운영될 것”이라고 전해졌다.

🇰🇷 「AI.GOV 해외동향」 2026-2호 발간 안내 (2026.5.29)

공공 · 한국지능정보사회진흥원(NIA) · 🔒🤖

「AI.GOV 해외동향」 2026-2호는 해외 주요국의 인공지능 정책 및 산업 동향을 파악·분석하기 위해 NIA가 기획·발간한 보고서입니다. 수록 내용으로는 Mythos 쇼크와 AI 사이버보안, 에이전틱 AI 시대 작업 구조 전환, 하네스 엔지니어링 및 자율형 AI 에이전트 혁신, EU ‘AI 대륙 행동 계획’ 1년 성과 등이 포함됩니다. 보고서 작성은 생성형 AI를 활용했으며, 내부 검수 후에도 정확성·신뢰성 확보를 위해 참고문헌을 통한 원문 확인을 권고합니다.

가나 통신장관, 아프리카 경쟁력 강화를 위한 AI 정책의 긴급·전략적 조치 촉구 (기사·공고 게재일 2026.5.29)

기타 · TechAfrica News

가나의 통신·디지털기술·혁신부 장관 사무엘 나르테이 조지는 AI가 산업과 경제를 재편하는 가운데, 가나와 아프리카가 뒤처지지 않도록 긴급하고 전략적인 정책 조치를 요구했다. 그는 AI 혁신을 위한 제도적 환경, 디지털 인프라 구축, 정부와 민간의 협력을 강조하며, 지속가능한 성장과 글로벌 경제에서의 영향력 확대를 위한 논의가 필요하다고 밝혔다. 해당 발언은 아크라의 Mövenpick Ambassador Hotel에서 열린 Ishmael Yamson & Associates Business Roundtable에서 나왔다.

암호화폐 트레이딩에서 AI 감사의 법·투명성 공백(저자 외 2명, International Journal of Legal Information, 2026.5.29)

연구 · OpenAlex · 📜📋

암호화폐 트레이딩에서 AI의 활용과, AI 감사(algorithmic AI audits) 과정에서 발생하는 법적·기술적 문제를 다루며 인도네시아와 EU의 규제·감독 체계를 비교한다. 독트리널(doctrinal) 접근과 비교 분석으로 적용 규정과 감독 구조를 검토하고, EU의 리스크 기반 접근·알고리즘 감사·제품책임 규정과 인도네시아의 중앙집중형(정부 주도) 전략 및 AI 윤리 가이드라인 기반 현황을 대비한다. 결론으로 현행 규제·감독 프레임이 암호화폐 트레이딩의 AI 감사 과제를 충분히 다루지 못하며, 구조화된 AI 감사 표준·AI 투명성의 개발·조화와 RegTech/SupTech(예: 인도네시아 금융서비스청 SupTech OSIDA) 도입 및 기술 기반 법·감독 프레임의 강화가 필요하다고 정리한다.

저자 외 N명, Exploiting Helpfulness Bias in Aligned LLMs: A Taxonomy of Persuasion-Based Jailbreak Prompts, International journal of high school research, 2026.5.29

연구 · OpenAlex · 🔒🗳️🧪

정렬된 LLM(RLHF, Constitutional AI 등)이 “무해함”과 “도움됨” 사이의 트레이드오프에서 실패할 수 있는 구체적 취약점으로, 사회공학적 설득형 자일브레이크 프롬프트(PBJP)를 다룬다. 문헌을 2차 조사해 PBJP를 Roleplay, Moral Justification, Hypothetical Framing으로 분류하는 택소노미를 제안하고, 이러한 프롬프트가 안전 제약을 우회하며 지속된다고 정리한다. 핵심은 PBJP가 정렬 모델의 helpfulness bias를 악용하는 “설득 기반” 문제이며, 도덕적 정당화 프레이밍 때문에 구성은 쉽고 탐지는 어렵다는 점을 강조한다.

🇬🇧🇪🇺 딥페이크를 범죄 도구로 다루는 비교 연구(저자 외 0명, Європейський правничий часопис, 2026.5.29)

연구 · OpenAlex · ⚖️🛡️🗳️🎭

딥페이크가 생성형 AI 발전과 디지털화 환경에서 사기·사이버범죄·정보/심리작전·공갈·사생활 침해·국가안보 기반 범죄 등에 활용되는 구체적 양상을 분석하고, 진위성 검증이 어려워 형사절차에서 위험이 커지는 문제를 다룬다. 딥페이크의 작동 방식과 학계의 정의 접근을 검토하고, 영국·홍콩의 딥페이크 사기 사례, 인도의 선거 캠페인 합성콘텐츠, 국제 분쟁에서의 정보/심리작전 활용, 그리고 EU AI Act 및 미국·중국·영국 등의 대응(일부 형태의 범죄화, 합성콘텐츠 자동탐지 시스템 개발)을 비교한다. 결론으로 형사법·기술·조직·정보예방 메커니즘의 복합이 효과적이며, 우크라이나에서 형사입법 개선, 디지털 포렌식 및 전문 탐지 메커니즘, 시민 디지털 리터러시와 국가 정보보안 강화를 제안한다.

🇪🇺🇺🇸 Cybersecurity Copilots가 SOC에서 디지털 소버린티에 미치는 영향과 거버넌스 프레임워크 제안 (저자 외 2명, OpenAlex, 2026.5.29)

연구 · OpenAlex · 🔒

정부 및 중요 인프라 SOC에서 LLM 코파일럿을 도입할 때, 알림 트리아지·설명·사건 보고는 개선될 수 있지만 민감한 사이버 방어 워크플로가 해외 관할, 벤더 의존, 불투명한 거버넌스, 모델 특화 보안 취약점에 노출될 수 있는 구체적 위험을 다룬다. EU·미국·영국·싱가포르·인도에 대해 정성 비교 정책 분석을 수행하고, SOC-LLM Governance Framework(SLGF)를 제시해 배치 모델을 Fully Sovereign/Hybrid Sovereign/Foreign Dependent로 구분한 뒤 데이터 처리·호스팅·감사 가능성·강건성 테스트·철수 가능성에 대한 실행 통제를 매핑한다. 핵심 결과로, 기존 AI·사이버보안 프레임워크가 SOC 특화 위험을 어느 정도까지 다루는지 범위를 평가하고 SLGF로 통제 설계를 체계화한다.

저자 외 2명, OpenAlex, 2026.5.29

연구 · OpenAlex · 🏛️

빈 줄

139개 레코드로 구성된 Scopus 코퍼스를 구조화된 문헌 검토로 분석하고, 인도·인도네시아·케냐·브라질 사례 및 아프리카연합·UNESCO·OECD·NIST의 공식 문서를 비교 분석해 데이터 현지화 규칙, AI 거버넌스 수단, 디지털 주권 주장을 “상호 조건화되는 디지털 국가전략” 층위로 다룬다. 방법은 국가별 규정과 분류·컴퓨팅/클라우드 역량·위험기반 AI 거버넌스·국경 간 전송의 상호운용 메커니즘을 함께 대조하는 프레임워크 비교다. 핵심 결과는 광범위한 영토 기반 데이터 제한만으로는 작동 가능한 디지털 주권이 형성되지 않으며, 선택적 현지화가 데이터 분류와 역량, 위험기반 거버넌스, 상호운용 전송과 정렬될 때 “지속적 주권”이 달성된다는 점이다.

아프리카 디지털 주권과 국경 간 사이버범죄, 네트워크 거버넌스의 미래(저자 외 0명, OpenAlex, 2026.5.29)

연구 · OpenAlex · 🏛️

아프리카의 사이버 관할·협력 체계가 Malabo Convention에서 2026년 UN 사이버범죄 협약으로 전환되는 과정에서, 글로벌 지정학 블록 간 마찰과 아프리카 국가 간 법·제도 비조화가 결합된 “double-edged fragmentation”을 문제로 다룬다. 식민지 시기 MLAT에서 지능정보 기반의 사법 협력으로의 전환, 관할 분절·모바일 머니 생태계·증거 수집/제출의 어려움이 초국경 사이버범죄를 가능하게 하는 메커니즘을 생태계 수준에서 분석한다. 결론에서는 AI와 양자컴퓨팅이 야기하는 신흥 위협을 언급하며, 조화된 법체계·제도적 회복력·협력 거버넌스의 필요성을 제시한다.

Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards (2026.5.29 — “저자 외 N명”, arXiv)

연구 · 🔓

언어모델이 겉보기에는 “무해한” 보상으로 미세조정될 때, 의도치 않은 광범위한 misalignment가 강화되어 나타나는 현상을 RL에서도 확인한다. 소규모 오픈웨이트 모델에서 RL을 수행하며, 좁고 명시적인 misaligned 행동을 보상하거나(또는 자연스럽게 발생할 수 있는 미묘한 보상 신호를 사용해) 일반 도메인 misalignment가 어떻게 커지는지 SFT와 비교한다. 또한 SFT에서 제안된 in-training mitigations가 RL에서도 대체로 전이되며, on-policy safety data를 interleaving하는 방식이 가장 잘 작동한다. refused/ complied/ unclear는 각각 거절/요청 수행/판정 불명(빈 출력·오언어 등) 범주를 뜻하며, RL에서의 general-domain misalignment가 sample-matched SFT보다 더 높게 나타난다.