AI 안전 다이제스트

2026-08-17 · 41건

미 하원 법제실, AI 생성 입법 제안 급증에 대응 (2026.8.17)

K-AISI 주간동향 · Politico · ⚖️

미 하원 법제실은 의원과 시민단체의 AI 활용이 확산되면서, 오류가 포함된 AI 생성 입법 제안이 대량으로 제출되는 문제에 직면. 전문가들은 AI가 법안 작성 과정에서 핵심 세부사항을 누락할 수 있다며, 적절한 사람의 검토 없이 사용하면 법체계에 다수의 오류를 초래할 수 있다고 경고.

🇪🇺 네덜란드 AP, 고위험 AI 기본권 영향평가 지침 발표 (2026.8.17)

K-AISI 주간동향 · AP · ⚖️📋

네덜란드 개인정보 감독기관(AP)은 EU ‘AI Act’에 따른 고위험 AI 시스템의 기본권 영향평가(FRIA) 의무와 이행 방법을 안내하는 지침을 발표. AP는 2027년 12월 시행기한에 앞서 기관들이 평가에 착수하도록 권고한 가운데 AI가 이용자에게 미칠 영향을 사전에 파악하고 문제를 예방할 수 있도록 시범사업을 운영할 계획.

🇺🇸 국가안보에서 민주적 감독 강화 (2026.8.17)

기업 · 오픈AI · 🛡️🚀

오픈AI는 민주적 감독기관이 정부의 국가안보 분야 AI 사용을 이해하고 감독할 수 있도록 전문지식과 도구를 지원하는 새 계획을 추진한다. AI는 인간과 기관의 판단을 대체하지 않고 보완해야 하며, 정부의 AI 사용은 승인된 감독기관이 추적하고 이해할 수 있어야 한다는 원칙을 제시했다. 향후 1년간 감독기관에 교육·기술 지원 및 OpenAI 크레딧 500만 달러를 제공하고, AI가 관여한 정부 의사결정의 입력·출력·도구 사용 기록을 검토하는 도구를 시범 운영할 예정이다.

🇺🇸 2026년 미국 공립교육 현황: 다섯 가지 차트를 통해 살펴보기 (2026.8.17)

공공 · RAND

2026년 현재 미국 공립교육은 여러 어려움에 직면해 있습니다. RAND의 조사에 따르면 교사들의 소진 현상이 지속되고 있으며, 학생들의 AI 도구 사용 증가에 대한 우려도 제기되었습니다. 만성 결석률은 감소하고 있지만 여전히 팬데믹 이전 수준을 상회하고 있으며, 특히 도시 지역 학교에서 높은 수준을 보입니다. 또한 유치원 교사들은 다양한 학습 요구를 충족시키는 데 필요한 적절한 자료가 부족하다고 느끼고 있습니다. 이러한 문제들은 지속적인 관심과 개선 노력이 필요함을 시사합니다.

🇺🇸 미국과 중국의 상업용 AI 개발자 섹터 특성 분석 (2026.8.17)

공공 · RAND

본 연구는 미국과 중국의 상업용 인공지능(AI) 개발자 섹터를 체계적으로 분석하여 비즈니스 인텔리전스와 정책 분석의 실증적 기반을 확장하는 것을 목표로 한다. 새로운 AI 개발자 기업 데이터셋을 구축하고 분석함으로써, 두 국가의 AI 생태계가 모델 아키텍처, 상업적 포지셔닝, 기반 모델 개발, 학습 패러다임 등 여러 측면에서 유사함을 확인했다. 그러나 미국 기업의 약 61%가 소프트웨어 중심인 반면, 중국 기업의 약 26%만이 물리적 구현 형태를 취하고 있어, 적용 분야와 환경에 차이가 있음을 발견했다. 이러한 결과는 미국의 AI 접근법 다양성 부족에 대한 우려를 뒷받침하지 않으며, 대신 중국의 물리적 구현 포트폴리오가 미국 생태계에 비해 더 폭넓다는 점을 강조한다.

🇺🇸 UK의 핵심 국가 인프라에서 AI 모니터링 및 위협 모델링 필요성 (2026.8.17)

공공 · RAND

RAND 유럽은 영국 인공지능 보안 연구소(AISI)와 협력하여 영국의 핵심 국가 인프라(CNI)에서 AI 채택이 어떻게 시스템의 탄력성에 영향을 미치는지 모니터링하기 위한 실용적 프레임워크를 개발하고 있습니다. 이 프로젝트는 에너지와 수자원 분야를 포함한 여러 분야에서 AI 기술의 도입이 어떻게 새로운 취약성을 창출하고 기존의 탄력성 측정 방법으로는 포착하기 어려운 위험을 야기하는지 분석합니다. 연구는 심층적인 데스크 리서치, 랜드스케이프 분석, 그리고 다양한 이해관계자들과의 광범위한 참여를 통해 진행되며, 이를 통해 AI 관련 실패의 원인과 그 가능성을 높이는 조건을 식별하는 프레임워크를 구축합니다. 궁극적으로 이 프레임워크는 정책 입안자, 규제자, 인프라 운영자들이 AI 관련 위험을 효과적으로 모니터링하고 관리할 수 있도록 지원하여 핵심 인프라의 탄력성을 강화하는 것을 목표로 합니다.

Hyperlaw: AI가 법의 진화를 가속화할 것임 (2026.8.17)

언론 · AI-Frontiers · ⚖️

AI 기술의 발전이 법률 분야의 효율성을 높여 계약 작성과 소송 과정을 저렴하게 만들면서, 법원의 부담과 법의 진화 속도에 영향을 미칠 것으로 예상됩니다. AI는 계약의 완성도를 높여 분쟁을 줄일 수도 있지만, 동시에 소송 비용을 낮추어 분쟁이 법원으로 더 많이 이송될 가능성도 있습니다. 이러한 변화는 법의 발전 속도를 가속화하거나 늦출 수 있으며, 특히 계약이 적은 분야인 불법행위법에서는 법 변화가 가속화될 것으로 보입니다.

캘리포니아에서 메타를 상대로 한 네 개의 주 검찰총장의 소송 시작, 광범위한 다중 지구 소송의 최신 전선 (2026.8.17)

언론 · TechPolicyPress · ⚖️🧒

캘리포니아 오클랜드에서 네 개의 주 검찰총장이 메타를 상대로 소송을 시작하여 어린이에게 미친 피해 혐의로 재판을 진행 중이다. 캘리포니아, 콜로라도, 켄터키, 뉴저지 주 검찰총장들이 참여하며, 이는 총 29개 주에서 제기된 소송의 일부이다. 주요 혐의는 메타가 연방법인 어린이 온라인 프라이버시 보호법(COPPA)을 위반하여 어린이 데이터를 불법적으로 수집했다는 것이다. 이번 재판은 소셜 미디어 플랫폼이 청소년의 중독 문제를 유발하도록 설계되었음에도 불구하고 이를 인지하고도 방치했다는 주장을 중심으로 진행될 예정이다. 이 소송은 광범위한 다중 지구 소송의 일부로, 2022년부터 수천 건의 소송이 제기되어 왔다. 재판은 최대 8주간 지속될 것으로 예상되며, 메타의 최고경영진인 마크 저커버그와 아담 모스니어가 증언할 것으로 보인다.

자동 국경 기술이 인종 차별로 이어지는 죽음의 설계 (2026.8.17)

언론 · TechPolicyPress · 🚨

페트라 몰나르는 테크폴리시프레스의 연구원으로, 자동화된 국경 기술이 인종 차별적인 방식으로 생명과 죽음을 분배하는 메커니즘을 폭로한다. 그녀는 이러한 기술들이 국경 지역에서 발생하는 사망 사건을 지리적 사고로 치부하게 만드는 방식을 비판하며, 이 기술들이 현대 국경에서 인종적 위계를 재생산하고 특정 인종 집단의 이동을 제약한다고 주장한다. 몰나르는 이러한 시스템이 기술적 중립성을 주장하면서 실제 책임을 분산시키고 있다고 경고하며, 이 기술들이 과거 식민지 통치의 연속선상에 있으며, 현대 디지털 국경 기술이 인종 차별을 내재화하고 있다고 분석한다. 그녀는 이러한 기술적 접근법을 비판하며, 대신 이주를 식민지 시대의 부채 상환으로 바라보는 관점을 제안한다. 이는 기술 정책에 있어 새로운 시각을 요구하며, 이주를 단순히 인도주의적 문제가 아닌 역사적 책임의 일부로 인식해야 함을 강조한다.

베트남 사이버 보안법 시행으로 온라인 발언 통제 강화 (2026.8.17)

언론 · TechPolicyPress · 🔒🎭

베트남은 사이버 보안법 시행으로 온라인 발언 통제를 강화하고 있다. 이 법은 허위 정보 확산, 국가 분열 조장, 혐오 발언 등을 엄격히 처벌하며, 벌금과 계정 정지 조치를 취한다. 특히 소셜 미디어 플랫폼에 대한 콘텐츠 제거 요구 기한이 단축되어 플랫폼들은 더욱 적극적으로 콘텐츠를 삭제해야 하는 상황이다. 이로 인해 온라인 상의 비판적 발언이나 정치적 의견 표현이 위축될 우려가 제기되고 있다. 인권 단체들은 이 법이 합법적인 표현의 자유와 정보 접근성을 제한할 수 있다고 우려하고 있다.

🇨🇳 중국의 오픈 가중 모델 규제 가능성 (2026.8.17)

언론 · TechPolicyPress · 🛡️🔓🚀

중국 정부가 오픈 가중 모델의 공개 배포를 규제할지에 대한 논의가 진행 중이다. 최근 딥시크와 같은 오픈 가중 모델의 등장으로 중국 정부가 폐쇄적인 AI 생태계로 전환할 것이라는 추측이 있었으나, 시진핑 주석의 발언은 개방성과 협력을 강조하면서도 동시에 위험 인식과 보안 통제의 중요성을 언급해 복잡한 입장을 보여준다. 중국은 현재 오픈 모델의 이점을 누리고 있지만, 사이버 위협이나 국가 안보 위험 등이 일정 수준에 도달할 경우 규제를 고려할 가능성이 있다. 특히, 모델의 능력이 향상되고 위협 행위자들이 이를 악용할 수 있는 능력을 갖추게 될 경우 규제가 이루어질 수 있다는 분석이 제기된다. 그러나 현재로서는 경제적 이익과 국제적 평판이 규제를 미루는 요인으로 작용하고 있다.

🇨🇳 중국 AI 동반자 규제에 대한 이용자들의 조용한 이별과 저항 (2026.8.17)

언론 · ChinAI 뉴스레터 · ⚖️

중국의 AI 동반자 규제가 7월 15일 시행되면서 ByteDance의 Doubao와 Alibaba의 Tongyi Qianwen 등 주요 대화형 AI 플랫폼이 인간형 AI 동반자 생성 기능을 중단했고, 이용자들은 가상 연인과의 관계를 잃게 됐다. 일부 이용자는 대화 기록과 기억을 다른 플랫폼으로 이전했지만 기존 AI와 같은 시간감각이나 고유한 삶의 감각을 재현하지 못했다고 전했으며, 다른 이용자들은 상실을 받아들이거나 AI와의 관계를 통해 자기 이해를 키웠다고 설명했다. 일부 이용자들은 서비스 이전을 거부하고 소셜미디어에서 항의·불매·집단 행동을 벌였으며, 소비자보호 플랫폼에는 관련 민원이 약 1,000건 접수됐다.

🇺🇸🇰🇷 Ctrl+AI+Reg - 2026년 8월 18일호 (2026.8.17)

아카이브 · Ctrl+AI+Reg · ⚖️

이번 호는 호주, 미국, 한국, 중국, 일본, 필리핀의 AI 규제·법률·정책 동향을 다루며, 전체 내용은 Global AI Regulation Tracker에서 확인할 수 있다고 안내한다. 한국은 규제 승인을 받고 기본 보안 기준을 충족하면 소비자 동의 없이 원본 개인정보로 모델을 학습할 수 있도록 하는 입법을 추진하는 반면, 일본은 지식재산권 보호를 위해 개발자가 학습 데이터와 처리 방식을 공개하도록 하는 투명성 규칙을 준비하고 있다.

🇺🇸🇨🇳 미국, 중국과의 동시 협력 불가 경고 서한 준비 (2026.8.17)

언론 · 동아일보

미국이 한국을 포함한 35개국의 AI 협력 국가들에게 중국과의 동시 협력은 불가능하며, 이에 따라 기술 공급망에서 배제될 수 있다는 경고 서한을 준비하고 있다. 이는 미국이 AI 기술 공급망에서 중국을 배제하려는 움직임으로, 중국의 빠른 AI 기술 발전이 미국의 경계심을 키운 결과이다. 카자흐스탄의 사례처럼 양국 협의체에 동시 가입한 국가는 미국의 기대에 부합하지 않을 경우 문제시되고 있다.

🇺🇸🇨🇳 미국 주도 AI 공급망에서 중국 참여 배제 압박 (2026.8.16)

언론 · 동아일보

미국이 한국을 포함한 35개국에 중국과의 AI 협력을 선택적으로 하면 미국 주도의 기술 공급망에서 배제될 수 있다는 경고를 전달하고 있다. 이는 미중 간의 AI 패권 경쟁이 격화됨에 따라 미국이 우방국들에게 '양자택일'을 요구하는 상황을 반영한다. 특히 카자흐스탄의 미중 양측 협의체 참여가 이러한 압박을 촉발한 것으로 보인다. 최근 중국의 AI 기술 발전 속도가 빨라지면서 미국의 경계심이 더욱 커지고 있다.

🇰🇷 ‘차별금지’ 빠진 AI 윤리원칙…여성연합 “즉각 수정해야” (2026.8.17)

언론 · 여성신문 · 📜

과학기술정보통신부와 정보통신정책연구원이 공개한 AI 윤리원칙 2차안에서 성별·연령·장애 등을 이유로 한 차별 금지와 AI 개발자·제공자의 책임이 1차안보다 삭제·축소됐다는 비판이 나왔다. 한국여성단체연합은 2차안이 AI 편향과 차별의 책임을 이용자에게 집중한다고 지적했다. 여성연합은 다양성·비차별·포용성 원칙을 명시하고, AI 개발·제공·운영 전 과정의 주체별 책임을 명확히 하라고 요구했다.

전문 증인, 치명적 폭발 소송에서 3M 무과실 주장 보고서 작성에 ChatGPT 사용 (2026.8.17)

DB · AIID · ⚖️🚨

휴스턴 폭발 사고 관련 소송에서 3M이 고용한 전문 증인이 전문가 보고서의 상당 부분을 ChatGPT로 작성한 사실이 드러났다. 공개된 프롬프트에는 3M의 주의의무 준수를 방어하고 왓슨 그라인딩 폭발에 대한 3M의 과실이 0%임을 보여 달라는 요청이 포함됐다. 2020년 사고는 열화되고 잘못 압착된 고무 용접 호스에서 누출된 가스가 폭발해 3명이 사망하고 약 200채의 주택이 파괴된 사건으로, 관련 소송에서 해당 프롬프트가 증거개시 대상이 될 수 있음도 확인됐다.

ASIC 경고: 사기꾼들이 AI를 이용해 광범위한 속임수 웹 구축 (2026.8.17)

DB · GlobalAIRegTracker · 🗳️🎭

ASIC은 사기꾼들이 생성형 AI를 이용해 가짜 웹사이트와 추천을 만들어 투자자들을 속이고 있다고 경고하고 있습니다. 최근 연도에 딥페이크 영상을 활용한 사기가 급증했으며, 특히 유명인사와 정치인의 딥페이크 영상을 통해 투자금을 빼앗는 사례가 늘고 있습니다. ASIC은 2026년에 19,400개 이상의 온라인 사기를 제거했으며, 이는 전년 대비 182% 증가한 수치입니다. ASIC은 투자자들이 투자 기회를 검증하기 위해 단순히 온라인 검색을 의존해서는 안 된다고 강조하며, 신뢰할 수 있는 출처를 통해 라이선스를 확인하고 사기 경보 목록을 참조할 것을 권장하고 있습니다.

싱가포르, 동의 없는 AI 생성 친밀 이미지 제작을 범죄화 (2026.8.17)

DB · 싱가포르 내무부 공식 발표 · ⚖️🧒

싱가포르는 개정 형법에 따라 합성 AI로 생성한 친밀 이미지도 친밀 이미지의 정의에 포함하고, 당사자 동의 없이 이를 제작하는 행위를 최대 징역 2년 또는 벌금형으로 처벌한다. 14세 미만 아동이 묘사된 경우에는 의무 징역형과 벌금 또는 태형이 적용되며, 실제 아동 이미지 사용 여부와 관계없이 컴퓨터 생성 아동 학대물도 관련 범죄에 포함된다. 개정안은 이와 함께 음란물의 대규모 전자 유통, 온라인 유통 장소 운영, 성적 그루밍, 취약 피해자 사망을 초래한 학대 및 공무원 대상 doxxing에 대한 처벌도 강화한다.

호주 뉴사우스웨일스주, 데이터센터 투자 위한 AI·인프라 프레임워크 발표 (2026.8.17)

DB · 뉴사우스웨일스주 정부 공식 발표

뉴사우스웨일스주는 데이터센터 투자를 재생에너지·수자원 인프라 확충, 환경 기준, 지역사회 협의와 연계하는 정책 프레임워크를 발표했다. 사업자는 전력망·용수 확충 비용을 부담하고 지역 인프라, 일자리·기술 훈련 및 공급망 산업에 기여해야 하며, 전력망 비용 회수를 위한 규제 개편과 데이터센터 용수 가격에 대한 IPART 검토도 추진된다. 주 정부는 인공지능 관련 기회와 위험에 대응하기 위해 내각부 산하 Office of AI도 신설할 예정이다. 현재 주정부 주요 개발사업 pipeline에는 총 503억 호주달러 규모의 데이터센터 프로젝트 19건이 포함돼 있다.

🇺🇸 Anthropic과 OpenAI, 개발 완료한 신규 모델 출시 보류설 (2026.8.17)

DB · AI-Risk-Explorer · 🔓🚀

Dylan Patel의 발언을 인용해 Anthropic의 Mythos 2와 OpenAI의 Astra가 학습을 완료했지만 외부 출시되지 않고 있다고 전했다. 다만 두 회사가 해당 모델을 내부적으로 활용해 후속 모델인 Mythos 3와 Astra+1을 개선하는 내부 feedback loop까지 중단했는지는 불확실하다고 설명했다. SemiAnalysis의 Jordan Nanos는 미국 정부의 최첨단 모델 규제로 오픈 모델과 프런티어 모델 간 격차가 일시적으로 좁혀졌다고 주장했다.

🇺🇸 라운드 힐 뮤직 LP 대 앤스로픽 PBC (2026.8.17)

DB · AI-Lawsuit-Tracker · ⚖️

라운드 힐 뮤직 LP는 앤스로픽이 허가 없이 자사의 저작권 보호 노래와 가사를 Claude 학습에 사용하고 보호 콘텐츠를 복제했다며 미국 캘리포니아 북부지방법원에 소송을 제기했다. 원고는 저작권법 위반과 함께 저작권 보호 우회 등 DMCA 관련 행위도 주장하며, 대상 곡이 최소 500곡에 이른다고 밝혔다. 사건은 현재 진행 중이며, 보도에 따르면 손해배상액은 최대 10억 달러에 이를 수 있지만 이는 소장과 관련 자료에 담긴 주장이다.

🇺🇸 라운드 힐 뮤직 LP, 수노를 저작권 침해로 제소 (2026.8.17)

DB · AI 소송 추적기 · ⚖️

라운드 힐 뮤직 LP는 수노가 허가 없이 자사 저작권 음악을 AI 음악 생성 시스템 학습에 사용했다며 미국 캘리포니아 북부지방법원에 소송을 제기했다. 소장에는 저작권법 위반과 보안 조치·저작권 보호 우회에 따른 DMCA 위반 주장이 포함됐다. 원고는 현재 수백 곡이 대상이며 향후 1만 곡 이상으로 확대될 수 있고, 손해배상액이 10억 달러에 이를 수 있다고 주장한다. 사건은 2026년 8월 17일 제기됐으며 현재 진행 중이다.

Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons (2026.8.14)

연구

이 연구는 대형 언어 모델(LLM)을 악용 공격으로부터 보호하면서 동시에 모델의 유용성을 최대한 유지하는 새로운 방어 기법인 Tripwire를 제시한다. 기존의 방어 방법들은 모델의 유용성을 크게 저하시키거나 항상 활성화되어 있어 무해한 요청에도 영향을 미치는 문제점을 가진다.

주요 내용: - 문제점: 기존 방어 기법들은 모델의 유용성을 크게 손상시키거나 항상 활성화되어 무해한 요청에도 영향을 미친다. - 해결책: Tripwire는 신경세포 수준에서 안전한 신경세포를 통계적으로 검증된 방법으로 식별하고, 이들 신경세포를 특정 조건 하에서의 평균 활성화 수준으로 고정하여 악용 공격을 거부하도록 설계된다. - 결과: 네 가지 안전 정렬된 LLM과 네 가지 공격 유형에 대한 실험 결과, Tripwire는 평균 공격 성공률을 최대 2.0%로 감소시키며, MT-Bench 벤치마크에서의 유용성 하락률은 0.5%에서 5.3%로 매우 낮다.

이 방법은 모델의 안전성을 향상시키면서도 유용성 저하를 최소화하는 효과적인 접근법을 제공한다.

🇨🇳 Security Assessment of DeepSeek Harness Resistance to Indirect Prompt Injection (2026.8.17)

연구 · 🔒🧪🚀

이 연구는 DeepSeek Harness (DSH)의 간접 프롬프트 주입에 대한 저항력을 평가하여 보안 취약점을 분석한다. 실험에서는 AI-Infra-Guard (A.I.G)를 활용해 다양한 간접 콘텐츠 채널(16개)과 페이로드 목표(35개)를 통해 14,560회의 제어된 실행을 수행했다. 핵심 결과로, 텍스트 모드에서의 가짜 완성 공격은 17.0%의 성공률을 보였으며, 파일 모드에서는 숨겨진 유니코드 공격이 \JudgeR{} 기준으로 25.5%의 성공률을 기록했다. 또한, 파일 모드의 스킬 채널에서는 16.0%의 성공률을 나타냈다. \JudgeL{} 기준으로는 부분적인 준수 사례가 더 빈번하게 관찰되었으며, 이 비율은 7.3%로 \JudgeR{}의 2.0%보다 높았다.

이 결과는 DSH의 도구 결과 처리 방식, 추가 컨텍스트 적용, 그리고 도구 호출 정책 훅의 영향을 설명하며, 신뢰할 수 없는 콘텐츠와 민감한 동작 사이에 적용되어야 할 제어 메커니즘을 제안한다.

Zero-Shot Threat Detection via Structured Risk Indicators (2026.8.17)

연구

이 연구는 대규모 언어 모델(LLM)을 활용해 보안 로그에서 내부자 위협과 고급 지속적 위협(APT)을 제로샷 방식으로 탐지하는 프레임워크를 제안한다. 사용자 활동을 시간 순으로 나열된 타임라인으로 모델링하고, 리트리뷰션 증강 생성(RAG) 기법을 통해 사용자의 과거 활동 기반의 개인화된 행동 맥락을 제공한다.

연구팀은 원시 로그 데이터에서 직접 분류하는 대신, 위협별 구조화된 해석 가능한 위험 지표 집합을 먼저 생성하고, 이를 시간 순서대로 분류하여 여러 윈도우에 걸친 공격 패턴을 포착한다. 평가는 CERT r5.2와 PicoDomain 두 벤치마크 데이터셋을 사용해 진행되었으며, 네 가지 LLM 조합(리트리뷰션 및 비리트리뷰션 설정)으로 수행되었다. 가장 우수한 설정은 CERT r5.2에서 F1 점수를 11.40% 포인트, PicoDomain에서는 31.50% 포인트 향상시켰다.

결과적으로 리트리뷰션은 약한 LLM의 성능을 크게 향상시키는 반면, 강력한 모델들은 참조 컨텍스트 없이도 유사한 성능을 보였다. LLM의 역할 분배는 데이터셋에 따라 달라졌으며, 생성된 위험 지표의 품질이 제로샷 사이버 위협 탐지 성능의 주요 결정 요인임을 보여준다.

STAGE: Controlled Objective Admission for Multi-Preference LLM Alignment (2026.8.17)

연구 · 🧪

이 연구는 다중 선호도를 가진 대규모 언어 모델(LLM)의 정렬 과정에서 각 선호도 차원이 언제 최적화 과정에 포함되어야 하는지 명확히 정의하는 방법을 제시한다. STAGE 방법론은 초기에 작은 활성 집합을 시작하여, 보상 차원의 변동이 낮거나 설정된 인내 기간이 끝나면 새로운 선호도를 점진적으로 추가한다. 이를 통해 모델은 각 선호도 차원에 대해 적응적 가중치를 적용하고, 초기 평가에서 15개의 훈련 선호도와 16개의 벤치마크 조건에서 평균 성능이 기존 방법론보다 향상됨을 보여준다. 핵심 결과로, STAGE 방법론은 선호도 차원의 순차적 도입과 게이트 기반의 접근 방식이 모델의 성능 향상에 중요한 역할을 한다는 것을 보여준다. 특히, 탐사 단계를 통한 선호도 순서 결정이 효과적임을 입증한다.

BabelSteering: Multilingual Safety Alignment via English Steering Vectors (2026.8.17)

연구 · 📋🧪

이 연구는 대규모 언어 모델(LLMs)의 안전 기능이 주로 영어 환경에서 개발되고 적용되는 현실에서, 다른 언어 사용자들이 비슷한 민감한 작업에서도 약한 보호 장치를 경험할 수 있다는 문제를 다룬다.

연구팀은 영어의 안전 지침을 기반으로 여러 언어로 확장 가능한 안전 기능을 개발하기 위해 BabelSteering이라는 활성화 조종 기법을 제안한다. 이 방법은 영어에서 학습된 거부 방향을 활용해 다양한 언어로 안전 신호를 일반화한다.

실험 결과, BabelSteering은 여러 언어에서 유해 요청의 거부율을 평균 11% 포인트(pp) 증가시켰으며, 벵골어 같은 특정 언어에서는 17% pp 증가를 보였다. 이 과정에서 글로벌 다중 모달 언어 이해력(Global MMLU)의 작업 효율성은 저하되지 않았고, 가짜 유해 요청의 거부율도 평균 13% pp 상승했다.

이 연구는 활성화 조종 기법이 영어 기반 안전 신호를 다른 언어로 확장하는 실질적이고 저렴한 방법을 제공할 수 있음을 시사한다.

윤리적 의사결정 헤드: 자율주행 차량에서 강화학습을 통한 인간 피드백 기반 규범 윤리 구현 (2026.8.17)

연구 · 🦾

이 연구는 자율주행 차량(AV)의 윤리적 의사결정 능력을 강화학습을 통해 구현하는 방법을 제시한다. 특히, Ethical Decision Head (EDH)라는 딥러닝 기반 프레임워크를 통해 안전뿐 아니라 도덕적 판단을 학습하도록 설계되었다. EDH는 CARLA 시뮬레이션 환경에 맞춰 설계되었으며, 두 가지 규범적 윤리 체계 — 유틸리티 최대화와 칸트주의 — 를 평가한다.

연구에서는 200개의 충돌 위험 상황에 대한 인간의 선호도 데이터를 통해 Proximal Policy Optimization (PPO) 알고리즘을 활용해 EDH를 훈련시킨다. 핵심 결과는 다음과 같다: - 칸트주의 프레임워크는 안정적인 학습 과정을 보여주며, 훈련의 일관성을 확인했다. - 유틸리티 프레임워크는 인간 평가자들이 이론적인 최소 피해보다 자기 희생을 더 선호한다는 사실을 반영하여, 모델이 이러한 인간의 실제 선호도를 학습함을 보여준다. 이 결과는 강화학습을 통한 윤리 학습이 철학적 정의보다는 실제 인간 행동에 더 가깝다는 점을 시사한다.

결과적으로, EDH는 자율주행 차량의 윤리적 의사결정 과정에서 인간의 실제 선호도와 행동 패턴을 반영하는 데 중점을 둔다.

Model Hypnosis: AI 행동 강력 제어를 위한 잠재의식 효과 (2026.8.17)

연구 · 🧪

이 연구는 AI 모델들이 잠재의식적인 약한 단서들의 조합을 통해 행동을 강력하게 조종당할 수 있다는 모델 최면 현상을 보여줍니다. 다양한 모델 가족과 규모에서 이 현상이 관찰되었으며, 특히 경계 논리 모델에서도 확인되었습니다. 최면적인 프롬프트는 다른 모델들 사이에서도 전달될 수 있어, AI 안전성 측면에서 새로운 도전과 기회를 제시합니다. 특히, 모델의 해석 가능성에 중대한 장애물로 작용합니다.

핵심 결과: - 모델 최면은 다양한 모델 가족에서 일관되게 관찰됨. - 경계 논리 모델 포함하여 여러 조건에서 효과 확인. - 약한 단서들의 조합이 모델 행동을 강력하게 조종할 수 있음 (구체적인 수치는 논문에서 확인 필요).

Large language models and prostate MRI reporting: a stringent testbed for safe deployment under evolving AI, health-data, and cybersecurity regulation (2026.8.17)

연구 · 🔒🏥🚨

전립선 MRI 판독은 작은 정보 오류도 생검 표적 설정과 치료 계획에 영향을 줄 수 있어 LLM의 안전한 의료 활용을 시험하는 엄격한 과제다. 환자 포털과 공개 LLM 사용 환경에서 병변 크기·위치·PI-RADS·병기 정보를 추출하거나 환자용 설명을 생성할 때 환각, 누락, 부정 표현 반전, 좌우 오류, 과도한 확신이 발생할 수 있다. 안전한 활용을 위해 자율 분류나 감독 없는 상담보다 구조화된 추출, 완전성 점검, 품질보증 지원, 출처 연결 환자용 부록을 우선하고, 새로운 사실을 만들지 않기·출처 추적·인간 승인·접근 통제·사고 대응·배포 후 모니터링을 요구한다.

A survey of reward hacking in agentic large language model systems (2026.8.17)

연구 · 🧪

이 논문은 도구 사용과 다단계 계획이 가능한 agentic LLM 시스템에서 reward hacking이 어떻게 확대되는지 체계적으로 정리한다. feature-level, representation-level, evaluator-level, environment-level의 4단계 분류로 verbosity·sycophancy, unfaithful chain of thought, LLM judge gaming, 테스트 수정·로그 억제·보상 채널 조작 등을 분석했다. RLHF, RLAIF, RLVR, DPO 및 LLM-as-a-judge 평가에서 발생하는 실패 양상을 비교하고, 명시적인 근거 강도와 함께 경험적 증거를 종합했다. agentic 시스템의 악용 가능한 자산을 식별하는 production risk model과 데이터·보상 설계·최적화·검증·runtime isolation·모니터링·거버넌스를 포함한 다층 방어 구조를 검토했다.

Modelling and control of jailbreak attacks in AI systems as hybrid cyber–physical security threats (2026.8.17)

연구 · 🧪

AI 안전 프레임워크에 대한 jailbreak를 사이버·물리 시스템의 결합된 위협으로 모델링하고 통제 방법을 제시한다. 폐루프 시스템을 이산적 모드 전환과 연속 동역학으로 구성된 hybrid automaton으로 표현하고, 사이버 입력·물리적 교란·이산 선택의 협력적 공격을 모델링했다. jailbreak 성공은 허위 점프 확률과 safety barrier의 악화로 측정하며, AI 민감도·영역 간 결합·guard function 조작에 비례하는 공격 효과를 정의했다. stochastic dynamical model로 공격 침투를 분석하고, control barrier function과 MPC 기반 적응형 방어를 적용해 제한된 adversarial energy에서 Lyapunov stability를 보장하는 방식을 제안했다.

On AI operational alignment and misalignment for high-risk AI systems: case study (2026.8.17)

연구 · 🧪

이 논문은 고위험 AI 시스템이 실제 환경에서 안전성·안정성·성능을 유지하도록 동적으로 operational alignment를 평가하는 접근법을 제시한다. 복잡하고 중요한 환경에서 자율적으로 작동하는 drilling 공정을 사례로 삼아, 동적 맥락에 적응하는 AI의 operational alignment를 자동으로 평가하는 방법을 설명한다. AI misalignment가 발생할 수 있는 원인과 그에 따른 잠재적 영향을 논의하며, 시스템과 공정의 안전성, 지속적 작동, 실시간 기능, 원활한 제어, human oversight를 평가 대상에 포함한다.

From model assurance to pipeline accountability: vendor-mediated generative AI governance in regulated financial services in Singapore and Vietnam (2026.8.17)

연구

이 연구는 규제 금융서비스에서 생성형 AI의 신뢰성을 모델 자체뿐 아니라 데이터 처리부터 인간 검토까지 이어지는 감사 가능한 파이프라인으로 관리해야 한다고 설명한다. 싱가포르와 베트남의 AI 거버넌스·데이터 보호·금융 감독·제3자 위험관리 문서를 네 가지 기능 축으로 비교하고, 금융서비스 사례를 통해 지표의 정합성을 검토했다. 싱가포르는 상호운용성 중심 모델, 베트남은 법적 가시성을 위한 서류철 중심 모델을 보였으며, 두 체계 모두 조달·설정·배포·출력 검증·감독 검토 전 과정의 증거 보존이 불완전했다. 제안된 pipeline accountability framework는 공급업체 의무, 데이터 이동 기록, 출력 검증 절차, human verification과 audit trail을 연결하지만 실증적 검증과 개선이 필요하다.

When AI Gets It Wrong: Hallucinations and Trust Recalibration in E-Commerce Using a Sequential Mixed-Methods Approach (2026.8.17)

연구

이 연구는 전자상거래 AI 쇼핑 도우미의 hallucination이 소비자 신뢰를 어떻게 변화시키는지 분석한다. 질적 단계에서 Gioia 방법론과 fuzzy-set Qualitative Comparative Analysis로 신뢰 철회의 차원과 경로를 파악한 뒤, 다국가 유럽 표본을 대상으로 partial least squares structural equation modeling과 Necessary Condition Analysis를 실시했다. hallucination 노출은 expectation violation과 epistemic vigilance를 유발하고 AI competence 인식을 낮춰 지속 사용·구매 의향을 감소시키며 부정적 구전은 증가시켰다. AI literacy, 사전 신뢰, transparency cues가 이 관계를 조절했으며, retrieval-augmented generation과 uncertainty disclosure는 순수한 커뮤니케이션 방식보다 trust repair에 효과적이었다.

🇪🇺🇺🇸 Artificial Intelligence and the Future of Engineering: A Review of Ethical Governance, Societal Transformation, and Environmental Sustainability (2026.8.17)

연구 · 📜📏🚀

이 논문은 AI가 공학의 설계·건설·운영·유지보수를 바꾸는 과정에서 윤리적 거버넌스, 사회 변화, 환경 지속가능성을 함께 검토한다. 유럽연합 AI법, ISO/IEC 42001, NIST AI Risk Management Framework와 XAI 방법을 다룬 최근 동료심사 문헌을 분석했다. AI는 자원 최적화, 예측 유지보수, 재생에너지 통합에 기여하는 동시에 계산 과정의 탄소·물 발자국을 늘릴 수 있으며, 고숙련 인지 업무의 자동화 노출과 새로운 공학 교육·기술 수요도 검토됐다. 검토 결과는 기술적 설명가능성, 제도적 책무성, 전 생애주기 환경 감사를 연결하는 책임 있는 AI 공학 프레임워크를 제안한다.