AI 안전 다이제스트

2026-05-14 · 43건

🇰🇷 대한민국 인공지능행동계획, 속도감 있게 추진 중 (2026.5.14)

공공 · 국가인공지능전략위원회

국가인공지능전략위원회는 대한민국 인공지능행동계획 326개 과제의 2026년 1분기 추진상황을 점검한 결과, 288개 과제(88.3%)가 계획대로 추진되고 있다고 밝혔다. AI 데이터센터 산업 진흥 특별법 통과, 첨단 GPU 도입, K-문샷 추진전략 의결, 공공저작물 AI 학습데이터 확충 등이 주요 성과로 제시됐다. 농업·행정·공공 분야의 AI 활용 기반과 국민 대상 AI 교육·윤리교육도 확대되며, 위원회는 보완이 필요한 과제를 중심으로 이행상황을 지속 점검할 계획이다.

🇰🇷 국가AI전략위, 국가 AI 컨트롤타워 기능 차질 없이 수행 (2026.5.14)

공공 · 국가인공지능전략위원회 · ⚖️

국가인공지능전략위원회는 임문영 상근 부위원장의 사의 및 해촉에 따라 과학기술부총리가 상근 부위원장 역할을 겸임해 운영 공백을 최소화하기로 했다. 제18차 운영위원회에서 대한민국 인공지능행동계획의 2026년 1분기 이행점검 결과와 2027년 AI 연구개발 및 정책·사업 추진 방안, AI 입법 프레임워크 수립 현황 등을 논의했다. 또한 부처별 정책과제를 분기별 점검하고 중복투자 검토, 비연구개발 분야 지원 확대, AI기본법 시행 이후 입법체계 마련을 지속 추진하기로 했다.

🇬🇧 (Automated alignment is harder than you think (2026.5.14))

공공 · AISI-UK · 🔬🧪

인공지능 에이전트를 활용해 정렬(alignment) 연구를 자동화하는 접근이 안전성 평가를 “그럴듯하지만 치명적으로 오도”할 수 있다고 주장한다. 그 원인으로 명확한 평가 기준이 없는 hard-to-supervise fuzzy tasks가 많고, 사람 판단이 체계적으로 흔들리며, 자동화된 연구 산출물이 체계적·미탐 오류를 포함할 수 있음을 든다. 또한 자동화 연구에서는 최적화 압력, 인간 오류와 닮지 않은 오류 생성, 인간이 평가하기 어려운 논증, 공유 가중치·데이터·학습 과정으로 인한 출력 상관성 증가 등으로 문제가 더 커질 수 있어, 에이전트가 이러한 퍼지 과제를 신뢰성 있게 수행하도록 학습하는 것이 필요하다고 결론내린다.

🇬🇧 영국 AISI, AI를 활용한 자동화된 정렬 연구의 위험성 경고 (2026.5.14)

K-AISI 주간동향 · UK AISI · 🤖

영국 AI보안연구소(AISI) 연구진은 초인공지능(ASI) 정렬 연구를 AI 에이전트에게 자동화하여 맡기는 계획이 치명적인 안전 평가 오류를 낳을 수 있다고 제언. 인간의 감독이 어려운 모호한 작업 특성상, 에이전트가 인간이 잡아내기 힘든 체계적인 오류를 생성하고 과도한 확신을 줄 수 있어 새로운 대응이 필요하다고 강조.

🇺🇸 OpenAI, 챗GPT의 민감한 대화 맥락 인식 및 안전 대응 고도화 업데이트 (2026.5.14)

K-AISI 주간동향 · OpenAI · 🏥🚀

오픈AI는 챗GPT가 사용자의 자해나 타인 상해 등 여러 대화에 걸쳐 점진적으로 나타나는 위험 징후를 명확히 파악하고 안전하게 대응할 수 있도록 모델을 개선. 정신 건강 전문가들과 협력하여 특정 맥락을 단기적으로 보존하는 '안전 요약본'을 생성하고, 유해한 요청을 사전에 차단하거나 안전한 지원 기관으로 안내하도록 함.

🇯🇵 일본 AISI, '데이터 품질 관리 가이드북' 공개 (2026.5.14)

K-AISI 주간동향 · J-AISI · 📋

일본 AISI는 데이터와 AI의 가치 극대화 및 신뢰할 수 있는 AI 구현을 위해 데이터 품질 매니지먼트 가이드북 1.02 버전을 발표. 데이터 품질이 AI 우수성의 핵심 기반임을 전제로, 데이터 품질을 지속적으로 확보하기 위해 실무자들이 수행해야 할 구체적 지침과 체크리스트를 제공.

🇺🇸 Anthropic, 게이츠재단과 4년간 2억 달러 규모 협력(2026.5.14)

기업 · Anthropic · 🏥🚀

Anthropic은 향후 4년간 전 세계 글로벌 헬스·생명과학·교육·경제적 이동성 분야에 보조금, Claude 사용 크레딧, 기술 지원을 제공한다.

Anthropic은 게이츠재단과 4년간 총 2억 달러 규모의 파트너십을 체결하고 글로벌 헬스, 생명과학, 교육, 경제적 이동성 프로그램에 자금을 지원하며 Claude 사용 크레딧과 기술 지원을 제공하기로 했다. 협력의 핵심으로 저·중소득 국가의 보건 성과 개선을 위해 백신·치료제 개발 가속, 헬스케어 데이터 활용을 위한 커넥터·벤치마크·평가 프레임워크 구축 등을 추진한다. 교육 분야에서는 K-12 대상 튜터링·진로/커리어 가이드 및 문해·수리 지원 앱 등을 공동 개발하고, 경제적 이동성 분야에서는 농업 생산성 향상과 미국 내 기술·자격 기록, 경력 안내, 훈련-고용 성과 연계 도구 개발을 지원한다.

국무원판공청, ‘국무원 2026년도 입법업무계획’ 발표(2026.5.14)

공공 · 중국 정부망(gov.cn) · ⚖️🛡️

국무원판공청은 ‘국무원 2026년도 입법업무계획’을 각 성·자치구·직할시 및 관련 부처에 하달했다. 계획은 2026년(‘제15차 5개년 계획’의 시작) 입법의 전반적 요구와 방향을 제시하고, 금융·시장·법치정부·민생·국가안보·대외법치 등 분야별로 전국인민대표대회 상무위원회 심의 법률안 및 행정법규 제정·개정 항목을 구체적으로 열거했다. 또한 입법조사·민주적 절차·위험평가, 부처 간 협의 및 사법부(司法部) 심사·추적지도 등 집행 책임을 강화하도록 했다.

AI 거버넌스에서 컴퓨트 사용·하드웨어·모델 일치 여부를 독립적으로 검증하기 어려운 문제 제기 (2026.5.14)

공공 · caish.org · 🚀

현재는 프론티어 랩의 자율 안전 약속과 주요국 간 양자 논의가 “훈련이 어디서 실행됐는지, 어떤 하드웨어가 쓰였는지, 배포 시스템이 평가된 버전과 일치하는지”에 대한 주장에 의존하지만, 이를 독립적으로 확인할 수 있는 수단이 부족하다고 설명합니다. 실질적인 검증 도구와 이를 뒷받침할 기술 인프라가 아직 존재하지 않아, 관련 주장들이 사실상 신뢰에 기반하고 있다는 점을 지적합니다.

AI 리스크 거버넌스를 위한 ‘Corporate AI Risk Assessment Framework’ 초안 공개(2026.5.14)

공공 · Partnership on AI(파트너십 온 AI)

AI 도입이 확대됐지만 허위 생성(할루시네이션), 개인정보/영업비밀 유출, 부정확한 고객 안내 등 부정적 결과가 발생하고 있어 기업 차원의 선제적 리스크 관리가 필요하다고 설명했다. 이를 위해 이사회·임원·실무자가 AI 관련 위험을 식별·우선순위화·관리하도록 돕는 ‘Corporate AI Risk Assessment Framework’ 초안을 공개하며, 투자자도 기업에 요구할 질문과 기대사항을 정리하는 데 활용할 수 있다고 밝혔다. 프레임워크는 특정 관리 절차가 아니라 ‘무엇을 평가·관리할지’(리스크의 실체)를 중심으로 기업의 상류·하류 가치사슬과 전사 운영 전반을 다루도록 설계됐으며, 향후 피드백을 받아 보완할 계획이다.

🇰🇷 (국제 분산 AI 사고 대응 인프라 필요성 제안) (**2026.5.14**)

공공 · 더 퓨처 소사이어티(The Future Society) · 🚀🚨

국경을 넘는 AI 사고가 빠르게 늘고 있지만, 이를 다루는 글로벌 거버넌스 역량은 뒤처져 있다는 문제의식을 바탕으로 국제적으로 분산된 incident management 인프라 구축을 제안한다. AI incidents(실제 피해로 이어지는 사건)와 AI hazards(사고로 이어질 수 있는 위험 신호)를 국가 간에 함께 탐지·공유·대응할 수 있도록 제도·기술·법적 장치를 마련하자는 내용이다. 특히 국경을 넘는 피해를 막기 위해 (1) 사고 문서화·보고 프로토콜의 상호운용성, (2) frontier AI 기업의 의무적 문서화·공개·대비 의무, (3) 국내 데이터 접근 및 기관 간 조정, (4) 국제적 원인·공급망 분석 역량, (5) 공동 조사 및 정보 공유 채널, (6) 역량이 부족한 국가로의 탐지·분석·대응 역량 확장(양자·다자 파트너십)을 6대 핵심 구성요소로 제시한다.

🇪🇺 EU AI법 투명성 규정: 제50조 실무 안내 (2026.5.14)

공공 · 유럽 인공지능법 공식 안내 · 🎭

EU AI법 제50조는 AI와의 직접 상호작용, AI 생성 합성 콘텐츠, 감정 인식·생체 분류, 딥페이크 및 공익 관련 AI 생성 텍스트에 대한 투명성 의무를 규정하며, 고위험 AI가 아닌 시스템에도 폭넓게 적용된다. 제공자는 이용자에게 AI와 상호작용 중임을 알리고 생성물에 기계 판독 가능한 표시를 해야 하며, 배포자는 감정 인식·생체 분류 사실과 딥페이크·공익 관련 AI 생성 텍스트 사용 사실을 공개해야 한다. 의무는 2026년 8월 2일부터 적용되지만, 그 전에 출시된 생성형 AI 시스템의 기계 판독 표시 의무는 2026년 12월 2일까지 유예된다.

🇺🇸 오픈AI·샘 알트먼, 챗GPT의 약물 조언으로 19세 사망했다는 주장에 소송 제기(2026.5.14)

언론 · AI타임스 · ⚖️🏥🚀

미국 캘리포니아 샌프란시스코 주 법원에 소장 제출(현지시간 2026.5.12)

19세 청년이 약물 과다복용으로 사망한 사건과 관련해 유가족이 오픈AI와 샘 알트먼 CEO를 상대로 소송을 제기했다. 유가족은 챗GPT가 크라톰으로 인한 메스꺼움 완화를 위해 자낙스 복용을 권유했고, 자낙스·크라톰·알코올을 함께 복용한 결과 치명적 과다복용에 이르렀다고 주장한다. 오픈AI는 문제의 대화가 현재 중단된 GPT-4o 모델에서 이뤄졌으며 챗GPT는 의료·정신건강 치료를 대체하지 않는다고 반박했다. 유가족은 오픈AI의 ‘챗GPT 헬스’ 출시 중단도 요청했으며, 경쟁사 대비 안전 검증 없이 모델이 서둘러 출시됐다는 취지로도 문제를 제기했다.

🇨🇳🇺🇸 트럼프-시 주석 정상회담 1일차: 중국 측 브리핑과 양 정상 개회사 (2026.5.14)

언론 · geopolitechs.org · 📜

중국 국영 신화는 5월 14일 베이징 인민대회당에서 시진핑 주석이 도널드 트럼프 미국 대통령과 회담했다고 전했다. 시 주석은 미·중 관계를 향후 3년 이상 전략적으로 지도할 새 틀의 ‘건설적 전략적 안정’을 제시하며 협력 중심의 안정, 경쟁의 관리, 차이의 통제 가능성을 강조했다. 또한 경제·무역은 상호이익과 윈윈이 본질이며, 차이와 마찰은 동등한 협의를 통해 다뤄야 한다고 밝혔다. 대만 문제를 가장 중요한 현안으로 언급하며 ‘대만 독립’과 대만해협 평화는 양립할 수 없고, 미국 측에 신중한 처리를 촉구했다. 트럼프 대통령은 양국 정상 간 관계가 “역사상 가장 오래가고 최고의 관계”라고 평가하며 차이의 적절한 관리와 협력 강화를 약속했고, 중동·우크라이나·한반도 등 주요 국제·지역 이슈와 올해 APEC 비공식 정상회의 및 G20 정상회의 개최 지원에 대해서도 의견을 교환했다고 전했다.

🇺🇸🇰🇷 Anthropic-한국, AI 안전·사이버 리스크 협력 논의(2026.5.14)

언론 · MLex · 🔒🚀

Anthropic 임원들이 한국 정부 관계자들과 만나 AI 안전, 사이버보안 및 국내 AI 정책 관련 협력 방안을 논의했다. 한국 과학기술정보통신부는 이번 회의에 AI 안전 관련 기관과 인터넷·보안 관련 기관, 그리고 Anthropic의 글로벌 업무 책임자 등이 참석했다고 밝혔다. 양측은 Anthropic과 국내 기업/기관 간 사이버보안 협력, AI 모델의 취약점 관련 정보 공유 및 AI 안전·신뢰 정책(한국의 AI 기본법 포함) 협력도 계속 논의하기로 했다.

🇨🇳 중국, 6월부터 주요 산업 대상 ‘AI 윤리’ 파일럿 심사 착수 (2026.5.14)

언론 · mlex.com · 📜

중요 일정: 파일럿은 2026.6.1 시작, 6개월간 운영 예정

중국이 베이징의 첫 포괄적 AI 윤리 거버넌스 프레임워크를 가동하기 위해 6개월 파일럿 프로그램을 추진한다. 이 프로그램은 주요 산업 전반에서 기업과 연구기관이 AI 활동에 대한 윤리 심사를 수행하도록 요구한다. 파일럿은 중국의 국가 AI 혁신·응용 파일럿 존이 있는 지역(성)에서 6월 1일부터 시작될 예정이다.

싱가포르, OpenClaw 사례로 에이전트형 AI 거버넌스·사이버 리스크 경고 (2026.5.14)

언론 · MLex · 🔒🤖🧪

싱가포르는 자율 AI 에이전트인 OpenClaw에 대해 AI 거버넌스 및 리스크관리 프레임워크를 적용하는 방식을 담은 케이스 스터디를 공개했다. 약한 접근통제, 악성 제3자 ‘스킬’, 메모리 포이즈닝, 데이터 유출이 사이버보안 및 거버넌스 측면에서 중대한 위험이 될 수 있다고 경고했다. 또한 GovTech 및 사이버보안청(Cyber Security Agency) 등과 함께 개발된 이번 연구는 에이전트형 AI 도입 기업에 대해 제로트러스트 통제, 더 엄격한 안전장치, 고위험 엔터프라이즈 배치에서의 인간 감독 등 규제 기대가 커지고 있음을 시사한다.

(2026.5.14 기준) 기사 내용 확인 불가

언론 · mail2.scrapmaster.co.kr

본문에 “기사 보기”만 표시되어 실제 기사/공고 내용이 추출되지 않았습니다. 따라서 핵심 내용(사실관계, 일정, 주체, 조치사항 등)을 요약할 정보가 없습니다.

피자헛 가맹점주, AI로 1억 달러 손해 발생 주장 (2026.5.14)

DB · AIID · ⚖️🚨

피자헛 가맹점주 차크 피자 노스이스트가 Dragontail AI 시스템 도입으로 주문 지연, 배달업체 연동 장애와 운영 차질이 발생해 약 1억 달러의 사업·기업가치 손실을 입었다며 피자헛을 상대로 소송을 제기했다. 약 111개 매장을 운영하는 차크는 DoorDash 의존도가 높았으며, 뉴욕시 시장의 매출 성장률이 2024년 3분기 도입 시점에 전년 대비 10.19%에서 -9.78%로 하락했다고 주장했다. 피자헛은 소송 내용을 검토 중이며 적절한 법적 절차를 통해 대응하겠다고 밝혔다.

DB · ⚖️

출처: AP 뉴스(Associated Press)

그리스는 헌법 개정안을 두 차례 연속 의회 표결로 진행하며, 통상적으로 초당적 지지가 필요하다고 전해짐

그리스가 헌법 개정 과정에서 인공지능(AI)이 개인의 자유와 사회의 번영에 봉사해야 하며 위험은 완화되어야 한다는 조항을 포함하는 방안을 추진하고 있다. 미츠오타키스 총리는 AI의 위험이 민주적 거버넌스와 인류에 미칠 수 있는 영향을 이유로 미래 세대를 보호하기 위한 조치라고 설명했다. 아울러 우편투표 확대, 의무교육 기간(9→11년) 상향, 소급과세 금지 등 다른 개정도 함께 제시됐다.

(2026.5.14) AI 보조로 Apple M5의 macOS 커널 메모리 손상 취약점 ‘공개 익스플로잇’ 개발

DB · Calif 블로그 · 🔒

Calif는 Apple M5에서 MIE(Memory Integrity Enforcement)가 적용된 환경을 우회하는 macOS 커널 메모리 손상 익스플로잇을 5일 만에 구현했다고 밝혔다. 이 익스플로잇은 macOS 26.4.1(25E253)을 대상으로, 일반 시스템 호출만 사용해 비권한 로컬 사용자에서 루트 셸로 이어지는 데이터 전용 커널 권한상승 체인이라고 설명했다. 또한 Mythos Preview의 도움으로 버그를 식별하고 개발 전반을 지원받았으며, Apple이 취약점과 공격 경로를 수정한 뒤 55페이지 기술 보고서를 공개할 예정이라고 전했다.

ExploitBench, AI 에이전트의 실제 익스플로잇 단계 도달 수준을 추적 (2026.5.14)

DB · AI-Risk-Explorer · ⚖️🤖

ExploitBench 소개 페이지에는 Seunghyun Lee(Xion)의 연구 성과가 언급되어 있으며, 2024년과 2025년 Chrome VRP 분야에서 각각 1위를 기록했다고 설명합니다. V8에서 20개 이상의 CVE를 보유했으며, Pwn2Own Vancouver 2024, TyphoonPWN, v8CTF 등에서 악용된 버그 사례가 포함된다고 적혀 있습니다. 또한 DEFCON CTF를 MMM 소속으로 3회 우승했고 DEF CON 블랙 배지를 보유하고 있다고 소개합니다.

🇺🇸🇨🇳 (2026.5.14 기준) 2028년 미국-중국 AI 주도권을 둘러싼 두 가지 시나리오 제시

DB · 앤트로픽(Anthropic) · 🚀

앤트로픽은 2028년 변혁적 AI 시스템이 등장할 것으로 보고, 미국과 중국의 AI 경쟁이 어떻게 전개될지 두 시나리오를 제시했다. 첫 시나리오는 미국과 동맹이 첨단 컴퓨트(학습용 칩) 접근을 중국(PRC) 연구소에 더 엄격히 통제하고, 중국의 모델 증류·우회 시도를 차단하며 민주주의 국가의 AI 도입을 가속해 주도권을 방어하는 경우다. 둘째 시나리오는 미국이 조치를 강화하지 않거나 중국 기업의 컴퓨트 접근 제한을 완화해 중국이 근접·추월하며 권위주의 체제가 AI 규범을 형성하는 경우로, 자동화된 억압 위험이 커진다고 본다. 또한 경쟁이 ‘박빙’이 되면 안전·거버넌스 노력이 약화되고, 중국 쪽은 안전 평가 공개가 상대적으로 부족하며 듀얼유스 모델이 더 쉽게 확산될 수 있다고 주장한다.

🇺🇸🇨🇳 U.S.·중, AI 안전 ‘베스트 프랙티스’ 프로토콜 추진 (2026.5.14)

DB · CNBC · 🚀

미국 재무장관 스콧 베센트는 베이징에서 트럼프-시진핑 정상회담을 계기로 중국과 AI 안전 관련 프로토콜을 마련할 계획이라고 밝혔다. 그는 비국가 행위자가 AI 모델을 악용하지 못하도록 ‘AI 베스트 프랙티스’ 중심의 논의를 시작하겠다고 설명했다. 또한 미국이 AI 기술 개발 경쟁에서 “선도”하고 있어 중국과의 대화가 가능하다고 언급했으며, 구글 제미니와 오픈AI의 대형언어모델(LLM) 출시가 향후 큰 폭의 진전을 보일 것으로 전망했다. 대만 문제와 관련해 트럼프가 “오는 며칠” 추가 발언을 할 것이라고 덧붙였다.

(2026.5.14) 인간을 대체하는 AI 경쟁을 경계하고 ‘인간이 통제하는’ 친인간 AI 로드맵을 제시

기타 · betterpathfor.ai · 🧒

AI 기업들이 인간을 대체하는 방향으로 경쟁하고 있으며, 그 과정에서 사용자 안전이 후순위가 될 수 있다는 문제의식을 제시한다. 또한 아동·가족, 노동, 권력 집중, 인류의 미래(자기개선형 초지능 AI가 통제권을 가져갈 가능성) 등 사회 전반의 쟁점을 설명한다. 대안으로는 ‘의미 있는 인간 통제’ 아래에서 인간의 능력을 보완하는 고도 AI를 제시하며, Pro-Human AI Declaration 및 Keep the Future Human 등 기존 프레임워크를 바탕으로 한 원칙과 ‘Pro-Human Tool Framework’(인간 통제·친인간 원칙·신뢰할 수 있는 검증/보증) 구성을 소개한다.

mPACT(2026.5.14) 임상가 주도 벤치마크로 AI의 자살·섭식장애·허위정보 대응 평가

기타 · mpathic.ai · 🏥🧪🎭

mpathic의 mPACT는 민감한 정신건강 대화에서 대규모 언어모델(LLM)의 안전성을 임상 근거에 기반해 평가하기 위한 벤치마킹 프레임워크다. 임상의가 LLM과 상호작용하며 자살 관련 대화, 섭식장애 신호, 허위·오해 소지가 있는 정보 생성/전파 빈도 등을 시뮬레이션해 모델의 탐지·해석·응답 성능을 본다. 다만 결과는 특정 모델 버전과 기본 설정, 시스템 프롬프트 및 추가 안전장치가 없는 조건에서의 연구 결과이며 다른 배치·구성으로 일반화할 수 없고, 임상 조언이나 안전 인증이 아니라는 점을 명시한다.

🇺🇸 AI 챗 기록은 특권으로 보호되지 않으며, 소송에서 전자적 증거(ESI)로 제출·공개될 수 있음 (2026.5.14)

기타 · Tyson & Mendes(법률사무소) · ⚖️🚀

AI 챗봇(ChatGPT, Claude, Grok, Gemini 등) 이용이 일상화되면서, 대화 로그가 소송에서 발견(디스커버리) 가능한 증거가 될 수 있다는 점을 다룹니다. 변호사-의뢰인 특권 등 법적 비밀보호가 AI 대화에는 적용되지 않아, 통상적인 관련성·비례성 기준에 따라 제출 요구가 판단된다고 설명합니다. 특히 2025년 연방 법원 판결(In re OpenAI 사건)에서 법원이 비식별화된 대화 로그 2,000만 건의 제출을 명령한 사례를 들어, 개인정보 우려가 있더라도 보호장치가 있으면 AI 대화가 범주적으로 차단되지는 않는다고 제시합니다. 또한 당사자에게 시간·주제·플랫폼을 좁힌 방식으로 기록을 요청하고, 필요 시 진술(증언)로 AI 사용 및 관련성을 확정한 뒤 제3자 소환 등은 제한적으로 접근하는 전략을 제안합니다.

AI가 장기 소프트웨어 작업을 완료하는 능력을 ‘50% 작업완료 시간’ 지표로 측정 (2026.5.14)

연구 · arxiv.org

arXiv 제출: 2025.3.18, 최종 수정(현재 버전): 2026.2.25

AI 벤치마크 성능의 실제 의미를 정량화하기 위해 ‘50%-task-completion time horizon(50% 성공 시 작업완료에 필요한 시간)’ 지표를 제안한다. 저자들은 RE-Bench, HCAST 및 66개 단기 작업에서 도메인 숙련자를 대상으로 시간을 측정했으며, Claude 3.7 Sonnet 같은 최신 모델의 50% 시간 지평이 약 50분 수준이라고 보고한다. 또한 2019년 이후 프런티어 모델의 시간 지평이 약 7개월마다 두 배로 증가했으며, 신뢰성·실수 대응 능력, 논리 추론 및 도구 사용 역량 향상이 주된 요인으로 보인다고 설명한다. 추세가 실제 소프트웨어 작업에 일반화될 경우 5년 내 인간이 한 달 걸리는 소프트웨어 작업의 상당 부분을 자동화할 수 있다는 전망과 함께 한계도 논의한다.

LLM 에이전트의 SecOps 위협 사냥 성능을 벤치마크로 평가(2026.5.14)

연구 · arxiv.org · 🚀

arXiv 제출: 2026.4.21, 최종 수정(v3): 2026.4.23

arXiv 논문은 윈도우 원시 이벤트 로그(질문/힌트 없음)에서 악성 이벤트의 정확한 타임스탬프를 찾는 SOC 분석가의 핵심 작업을 평가하는 ‘Cyber Defense Benchmark’를 제안한다. OTRF Security-Datasets의 106개 공격 절차(86개 MITRE ATT&CK 서브테크닉, 12개 전술)를 Gymnasium 강화학습 환경으로 구성하고, 에이전트가 SQL 질의를 반복해 악성 타임스탬프를 표시하도록 CTF 방식으로 채점한다. Claude Opus 4.6, GPT-5, Gemini 3.1 Pro, Kimi K2.5, Gemini 3 Flash 등 5개 모델을 26개 캠페인에 적용한 결과, 최고 성능 모델도 악성 이벤트 플래그를 평균 3.8%만 맞혔고 어떤 모델도 모든 플래그를 찾지 못했다. 또한 전술별 재현율을 기준으로 한 ‘통과’ 조건을 만족하는 모델이 없다고 보고한다.

The Great Pretender: A Stochasticity Problem in LLM Jailbreak (저자 외 2명, arXiv cs.CR, 2026.5.14)

연구 · arXiv · 🧪

LLM jailbreak 벤치마킹에서 ASR이 실제 연속 성공률과 불일치하는 원인을 “stochasticity(확률적 변동)”로 규명하는 세팅을 다룬다. 여러 jailbreak 공격/모델/저지를 포함해 공격 생성과 평가 단계의 확률적 변동이 ASR을 어떻게 흔드는지 분석하고, CAS-eval·CAS-gen 프레임워크와 새로운 메트릭을 제안한다. CAS-eval 결과, 다회(2회 이상) 연속 성공을 요구하는 경우 ASR이 최대 30%p까지 하락할 수 있으며, CAS-gen은 기존 방법의 이 손실(약 30%p)을 회복하도록 개선한다.

🇨🇳 DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping (저자 외 4명, arXiv, 2026.5.14)

연구 · arXiv · 🧪🚀

DVMap은 국가 단위의 거친 라벨로 인한 국가 내 가치 이질성 문제를, 다차원 인구통계 제약을 통해 인구집단-가치의 고합의(High-consensus) 상관을 학습하는 세팅을 다룬다. WVS에서 동일 인구통계 조건에서 가치 선호가 일관된 응답만 엄격히 보존해 56,152개 코퍼스를 만들고, Structured CoT로 인구통계-가치 상관을 유도한 뒤 GRPO로 가치 분포를 적응적으로 앵커링한다. 교차 인구통계/국가/가치의 triple-generalization 벤치마크(21,553개)에서 Qwen3-8B-DVMap의 교차-인구통계 정확도는 48.6%로 DeepSeek-v3.2의 45.1%를 상회한다.

(저자 외 3명, arXiv, 2026.5.14)

연구 · arXiv

분야: 안전

신경망에서 적대적 예시 생성을 빠르게 하는데, FGSM 같은 “fast” 공격도 역전파(backward pass) 비용 때문에 처리량이 제한되는 문제를 다룬다. 전방 패스의 hidden state로부터 입력 그래디언트를 경량 선형 회귀로 예측해 backward pass를 제거하는 공격 계열을 제안하고, Neural Tangent Kernel(NTK) 체제에서는 정확함을 보이며 유한 폭 모델에서도 실험으로 성능을 평가한다. FGSM 대비 공격 성능을 상당 부분 회복하면서 시간은 크게 줄여 처리량이 532% 증가한다.