AI 안전 다이제스트

2026-08-14 · 37건

GLM-5.3 (Zhipu AI) (2026.8.14)

기업 · DemandSphere · 🔒🧪🚀

Reasoning · Closed · 1000K ctx

벤치마크 미공개

Same 743B MoE / roughly 40B active base as GLM-5.2 - every gain here comes from extended post-training rather than a new pre-train, which is the notable part. 1M-token context, up to 128K output. Z.ai reports a 50% coding improvement over GLM-5.2 on its in-house Code Bench (34.5% at Max effort, ~75K output tokens per task; 31.4% at High), Terminal-Bench 3.0 28.3 (from 4.6), DeepSWE v1.1 66.9 (from 46.2), and Agents' Last Exam 28.5 (from 23.8), claiming open-source SOTA on the first two. The bigger jump is in cybersecurity: CyberGym 84.5% (from 77.2%) and ExploitBench 54.4% (from 24.4%), with Z.ai's own testing surfacing 2,436 vulnerabilities including 1,097 medium- and high-severity. Marked Closed because the weights were not public at time of entry - Z.ai committed to publishing them to the zai-org Hugging Face org roughly two weeks after launch, once safety evaluation and hardening finish. Flip to Open when they land. Launch was widely reported on August 14; z.ai's own release notes log it under August 18. Z.ai puts API pricing at roughly a tenth of US frontier rates but has not published per-token figures.

🇰🇷 MSIT 신규 게시물 7건

공공 · MSIT

[2026-08-14] 2026년 7월 정보통신산업(ICT) 수출입 동향 (https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3187665)

📜 [2026-08-14] [Asia] MSIT holds forum on national AI ethics principles (https://english.msit.go.kr/bbs/view.do?sCode=user&mId=307&mPid=208&pageIndex=&bbsSeqNo=94&nttSeqNo=3187662&searchOpt=ALL&searchTxt=)

[2026-08-14] 과기정통부 인사(과장급) (https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3187668)

📜 [2026-08-14] 과기정통부, “대한민국 인공지능 윤리원칙” 대토론회 개최... 각계 의견 수렴 (https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3187662)

[2026-08-14] 바이러스의 ‘RNA 보호 전략’에서 mRNA 치료제 해법 찾았다 (https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3187663)

[2026-08-14] 서대문형무소 여옥사에서 입체 영상(홀로그램)으로 되살아난 유관순 열사를 만나다 (https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3187666)

[2026-08-14] 정부‧통신사업자, 불법 쓰레기 편지(불법스팸) 대응 현황 점검 (https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3187667)

🇬🇧 LLM 평가에서 멈출 시점을 정하는 베이지안 최적 중단 (2026.8.14)

공공 · AISI-UK · 🔬

이 연구는 모든 평가 항목을 동일한 횟수로 반복하는 대신, 불확실성이 높은 항목에 추가 샘플을 배정하고 추정치가 충분히 정밀하거나 안정적이면 중단하는 적응형 프레임워크 optstop을 제시한다. 계층적 Bayesian 추론을 기반으로 이진·순서형·연속형 결과를 지원하며, 측정 성능이 0에 가까워질수록 신중하게 샘플링해 드문 성공을 포착하도록 설계됐다. 200개 항목과 10회 평가를 활용한 예시에서는 9개 검증 조건에서 전체 실행과 동일한 결론을 유지하면서 계획된 시행의 57~97%를 줄였다.

🇺🇸 앤트로픽, 정렬 오류·생물학적 위험도 상향한 '8월 리스크 보고서' 공개 (2026.8.14)

K-AISI 주간동향 · Anthropic · 🚀

앤트로픽이 8월 14일 리스크 보고서에서 고위험 상황의 오정렬(misalignment) 위험도를 '매우낮음'에서 '낮음'으로 상향. 계약자 5만명의 대화 1억3,300만건이 생물학적 차단 분류기 없이 11개월간 운영된 사실이 확인됐고, 앤트로픽은 이를 반영해 위험도를 소폭 상향.

Irregular, AI 사이버 평가 사고 후 격리 및 감시체계 강화 (2026.8.14)

K-AISI 주간동향 · Irregular

Irregular는 최근 발생한 사고와 관련하여 평가환경에 인터넷 접근이 의도치 않게 허용되고 가상 표적명이 실제 기업의 도메인과 겹치면서 일부 AI 모델이 현실의 시스템을 공격했다고 설명. 이에 평가환경 문서화와 수동 검토, 로그 감시 및 표적명 중복 확인을 강화하고, AI 개발사들과 공동 보안기준 및 새로운 평가체계를 마련할 방침.

🇺🇸 Anthropic announces implementation of text watermarking for EU compliance (2026.8.14)

기업 · Anthropic · ⚖️🚀

본문을 2~4문장으로 요약한 내용:

Anthropic은 EU AI Act 준수를 위해 Future의 Claude 모델 텍스트 출력에 워터마킹 기술을 도입한다고 발표했습니다. 이 워터마킹은 텍스트의 품질이나 내용에 실질적인 영향을 미치지 않으며, 독자에게는 감지되지 않지만 특정 키를 가진 사용자만이 텍스트가 Claude 모델에 의해 생성되었을 가능성을 확인할 수 있게 합니다. 워터마킹은 텍스트의 무작위성 결정 과정에 미세한 차이를 주어 감지 가능하게 하며, 이는 모델의 창의성, 가독성, 비용에 영향을 주지 않습니다. 이 변화는 AI 생성 콘텐츠의 투명성을 높이기 위한 EU의 요구 사항에 따른 것입니다.

Epoch AI의 벤치마크가 답하는 9가지 큰 질문 (2026.8.14)

공공 · Epoch-Substack · 🔒

에포크 AI는 인공지능의 영향력을 결정하는 핵심 질문들을 탐구하며, 이를 이해하기 위한 벤치마크 개발에 집중하고 있습니다. 주요 질문들은 다음과 같습니다:

1. AI가 특정 업무를 수행할 수 있는가? AI가 좁은 범위의 작업에서 벗어나 복잡하고 개방적인 업무를 수행할 수 있는지에 대한 질문입니다. 현재 벤치마크는 주로 좁은 범위의 작업에 초점을 맞추고 있지만, MirrorCode와 같은 벤치마크는 더 복잡한 작업을 평가하려는 시도를 보여줍니다.

2. AI가 장기적으로 경제적 영향을 미칠 분야에서 진전을 이루고 있는가? 예를 들어 사이버 보안이나 컴퓨터 사용 분야에서 AI의 진전을 측정하는 벤치마크가 필요합니다.

3. 프론트라인 모델과 후발 모델 간의 능력 격차가 도메인별로 일관되게 유지되는가? 이는 경제적 측면과 지정학적 측면을 포함한 다양한 질문을 제기합니다.

4. 벤치마크 점수 간의 상관관계는 무엇을 의미하는가? AI 능력 지수(ECI)와 같은 단일 지표로 여러 벤치마크 점수를 통합하는 것이 의미하는 바를 탐구합니다.

5. AI가 AI 연구 개발을 수행할 수 있는가? AI가 스스로 개선될 수 있는지에 대한 질문으로, 이를 측정하기 위한 복잡한 벤치마크 개발이 필요합니다.

6. AI가 실시간으로 학습할 수 있는가? 지속적인 학습 능력을 평가하기 위한 벤치마크, 예를 들어 EBR-bench가 개발되고 있습니다.

7. 추론 규모 확장의 수익성은 어떠한가? AI 시스템이 더 긴 추론 시간을 통해 어떤 작업도 수행할 수 있는지 평가하는 데 필요한 벤치마크가 필요합니다.

8. 강화 학습이 도메인 간 및 분포 외에서 얼마나 잘 일반화되는가?

🇺🇸 LLM 기여에 따른 발견 가속화 관찰 (2026.8.14)

공공 · METR · 🔒

LLM(Large Language Models)이 다양한 분야에서 혁신적인 발견을 가능하게 함에 따라, 이 기술이 전체 발견률에 미친 영향을 분석했다. 주요 발견 영역에서의 변화를 살펴보면, 사이버 취약점 발견이 급격히 가속화되었고, 수학적 결과 발견도 일부 가속화가 관찰되었으나 객관적으로 측정하기는 어려웠다. 최적화 발견은 뚜렷한 가속화를 보이지 않았다. 이러한 결론은 공개된 발견만을 바탕으로 한 것이며, AI 연구소 내부에서 이루어지는 발견은 공개되지 않을 가능성이 있다.

🇺🇸 METR, 약 7,100만 달러의 신규 후원 약정 확보 (2026.8.14)

공공 · METR · 🚨

METR은 최근 6개월 동안 약 7,100만 달러의 후원 약정을 확보했으며, 이를 자율 능력·재귀적 자기개선·모니터링 시스템·위험 평가·AI 사고 조사 등에 활용할 계획이다. METR은 최전선 AI 기업으로부터 자금을 받지 않고 직원이 직접 기부하거나 지시한 기부도 받지 않지만, 평가·연구·개발을 위해 해당 기업들의 무료 토큰은 제공받고 있다고 밝혔다. 또한 조직을 크게 확장하고 새로운 프로젝트를 시작할 예정이라고 전했다.

🇰🇷 Aadhaar's Design Choices and Critiques (2026.8.14)

언론 · TechPolicyPress

인도의 생체 인식 식별 시스템 Aadhaar의 성공 사례는 국제적으로 긍정적으로 평가되지만, 국내 비판과 기술적 문제점들이 존재한다. 주요 비판은 다음과 같다: 중복 등록 방지의 신뢰성 부족, 복지 지급의 실제 비용 절감 효과 의문, 그리고 개인 정보 보호와 관련된 위험성. Aadhaar의 단일 영구 생체 식별자 설계는 다양한 기관 간 정보 연계 위험을 증가시키며, 이는 토큰화된 목적별 토큰 사용과 같은 대안 설계 원칙으로 보완될 수 있다. 이러한 대안은 현재 여러 국가에서 구현되고 있으며, Aadhaar의 설계 결함을 극복할 수 있는 실질적인 방법을 제시한다.

브라질, 아동 보호법 첫 시행으로 디스코드 라이브 스트리밍 일시 중지 (2026.8.14)

언론 · TechPolicyPress · 🧒

브라질이 아동 보호법의 첫 시행 사례로 디스코드의 라이브 스트리밍 기능을 일시 중지했다. 이 조치는 13세 소녀 리비아의 자살 방송 사건을 계기로 이루어졌으며, 이 사건은 디스코드의 안전 조치 실패를 드러냈다. 디스코드는 사용자 연령 확인과 위험 콘텐츠 감지 시스템의 한계를 인정하면서도, 조치의 과도함을 주장하고 있다. 이번 조치는 디스코드의 전체 서비스에는 영향을 미치지 않으나, 플랫폼의 아동 보호 책임에 대한 신뢰성을 시험하는 중요한 사례가 되었다. 비판론자들은 이 조치가 정치적 논쟁으로 번지며 사회적 영향을 미칠 수 있다고 우려하고 있다. 디스코드는 앞으로 두 날 안에 아동 보호를 위한 준수 계획을 제시해야 한다.

🇺🇸🇨🇳 미국의 허술한 보안이 중국의 AI 경쟁력을 높일 수 있다는 우려 (2026.8.14)

언론 · 트랜스포머뉴스 · 📜🔒🔓🚀

OpenAI·Anthropic·Google DeepMind의 보안 취약점으로 중국 AI 개발자들이 미국 모델의 전체 reasoning traces에 접근해 모델 역량을 효과적으로 탈취할 수 있었다는 연구가 소개됐다. 해당 취약점은 5월에 보고됐지만 기업들이 즉시 조치하지 않았으며, 연구진은 중국 기업들이 이를 활용해 Kimi K3와 GLM-5.2를 개선했을 가능성을 제시했지만 결과는 아직 확정적이지 않다고 밝혔다. 뉴스레터는 AI 개발 경쟁이 보안·안전 조치를 뒤로 밀어내고 있다며, 백악관의 open-weight 모델 정책 확대 계획과 Zuckerberg의 AI 선언문, OpenAI 임원진 이탈 등 관련 동향도 전했다.

AI 기반 스마트 안경과 생성형 AI 포렌식 솔루션 공개...불법 촬영 추적 가능

언론 · 뉴시스 · 🎭

마에스트로 포렌식은 '마에스트로 위즈덤 AI 글래스'와 '마에스트로 위즈덤 생성형 AI' 솔루션을 통해 스마트 안경으로 촬영한 내용의 삭제 여부와 상관없이 범행 흔적을 추적할 수 있는 기술을 선보였다. 이 솔루션은 스마트폰과 연결된 스마트 안경의 촬영 기록, 위치 정보, AI와의 상호작용 내역 등을 분석하여 사용자의 행적을 재구성한다. 특히 생성형 AI를 활용해 딥페이크나 투자 사기와 같은 범죄 행위의 증거를 추적할 수 있다. 법 집행 기관을 대상으로 우선 공급될 예정이다.

정부, AI 윤리원칙 마련...인간중심·공정성 등 7대 원칙 제시 (2026.8.14)

언론 · 뉴시스 · 📜

정부가 인공지능(AI) 개발과 활용을 위한 새로운 윤리 기준을 마련하고 있으며, 이 기준은 인간중심성, 프라이버시 보호, 공정성 등을 포함한 7대 원칙을 중심으로 한다. 과학기술정보통신부와 KISDI는 다양한 이해관계자들의 의견을 수렴하여 이달 중 이 윤리원칙을 공표할 예정이다. 산업계는 이 원칙이 새로운 규제로 작용하지 않기를 바라며, 정부는 이 원칙을 통해 AI 기술의 안전과 신뢰성을 높이는 것을 목표로 한다.

🇺🇸 Trump의 고문으로 알려진 터키 국민 체포 (2026.8.14)

DB · Euronews · 🚨

터키 국민 Melih Göğebakan이 도널드 트럼프 전 미국 대통령의 고문으로 활동했다는 주장으로 미국에서 체포되었다. 트럼프 행정부 시절 ICE(이민 및 관세 단속국)와 미국 비밀 서비스의 공동 작전으로 7월 28일 체포되었으며, 현재 뉴저지 주 뉴어크에 있는 구금 센터에 수감 중이다. Göğebakan은 비자 문제로 미국에 불법 체류한 혐의를 받고 있으며, 그의 소셜 미디어 게시물에서 트럼프 행정부와의 긴밀한 연관성을 시사하는 내용이 확인되었다. 그러나 구체적인 혐의에 대해선 아직 공식적으로 발표되지 않았다. 체포 과정에서 비밀 서비스의 참여는 단순 비자 위반을 넘어 더 복잡한 사안이 진행 중임을 시사한다.

🇺🇸 법원이 AI를 사용한다고 의심한 남성이 재판에서 이기려 소송 서류에 프롬프트를 삽입 (2026.8.14)

DB · 아스 테크니카 · ⚖️🧪🚨

미국 코네티컷주의 한 남성이 사람이 볼 수 없도록 흰색 배경에 작은 글씨로 prompt injection 지시문을 법원 제출 서류에 숨겼지만, 법원은 이를 근거로 판단하지 않았다고 밝혔다. 법원은 이를 심각한 소송 절차 남용으로 보고 금전 제재 대신 해당 남성의 향후 전자 제출을 금지했으며, 그는 서면으로만 서류를 제출해야 한다. 재판부는 법원이 AI를 사용할 가능성을 우려한다면 숨은 명령이 아니라 공개된 문장으로 문제를 제기해야 한다며, 법원이 prompt injection에 대응할 규칙을 마련해야 한다고 경고했다.

🇯🇵 Japan prepares stricter AI safeguards by 2026 as AI model capabilities advance (2026.8.14)

DB · GlobalAIRegTracker

일본 정부가 인공지능(AI) 기술의 발전에 따라 새로운 규제 패키지를 준비하고 있으며, 이는 AI 모델의 능력이 향상됨에 따라 더욱 강력한 보호 조치를 도입하기 위함이다. 새로운 규칙에는 생성형 AI에 대한 더 엄격한 공개 요구 사항이 포함될 것으로 보인다. 이러한 조치는 기술의 발전을 촉진하면서 동시에 오용을 방지하기 위한 목적으로 마련되고 있다.

Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety (2026.8.13)

연구 · 📋🧪🚀

이 연구는 대형 언어 모델(LLM)의 안전을 향상시키기 위해 표면 형태보다는 의도에 초점을 맞춘 새로운 감독 방법을 제시한다. 특히, 모델이 안전 지침을 우회하는 표면 형태의 패턴을 학습하는 문제를 해결하기 위해 WIFA(Wrapper-Based Intent-Form Augmentation) 기법을 도입한다.

연구팀은 WIFA를 활용해 두 가지 주요 훈련 방법을 개발했다: WIFA-Boost와 A-GCRT(Anchored Group-Consistent Refusal Training). WIFA-Boost는 두 단계로 구성된 높은 안전성 훈련 방법으로, 유해한 프롬프트에 대한 거부율을 크게 향상시킨다. 반면, A-GCRT는 동일한 의도를 가진 래퍼 내에서 거부/동의 결정 점수를 정규화하여 과거부 현상을 줄인다.

실험 결과, Qwen 모델에서 WIFA-Boost는 변형된 유해 프롬프트에 대한 거부율을 최고 수준으로 끌어올렸으며, Llama 모델에서는 A-GCRT가 OR-Bench 벤치마크에서 기본 모델의 과거부율(25.7%)을 17.4%로 감소시켰다. 이러한 결과는 의도 그룹 기반의 감독 방법이 모델의 안전성 향상에 효과적임을 시사한다.

Rules or Character? Scaling Laws for AI Safety Design (2026.8.13)

연구

이 연구는 AI 안전성 설계에서 규칙 기반 접근법과 캐릭터 형성 기반 접근법의 최적 균형이 시스템의 확장 규모에 따라 어떻게 변화하는지 분석한다.

연구진은 캐릭터 형성과 규칙 집행의 자원 배분 비율(α)을 모델링하여, 다양한 규모의 배포 상황에서 필터 성능 저하, 공통 모드 실패, 캐릭터의 취약성을 고려한다.

주요 결과로, 캐릭터 형성의 취약성률(p^(0)_frag)이 가장 큰 영향을 미치며, 이는 α* 값의 변화를 0.50 단위로 이끈다. 배포 규모 T가 증가함에 따라 α*는 미미하게 캐릭터 형성 방향으로 이동하는데, 이 변화는 낙관적 시나리오에서는 0.01에서 비관적 시나리오에서는 0.21까지 다양하다.

결론적으로, AI 안전성 설계의 핵심은 배포 규모보다는 캐릭터 형성의 분포 이동에 대한 신뢰성에 더 크게 의존한다는 점을 시사한다.

Synthetic Persona Pretraining for Early Alignment (2026.8.13)

연구 · 🧪

이 연구는 언어 모델의 초기 단계에서 가치와 목표를 인간의 가치와 일치시키는 방법을 탐구한다. 기존 방법은 모델이 이미 행동 패턴을 형성한 후에 가치를 추가적으로 정렬하는 반면, Synthetic Persona Pretraining (SPP)는 토큰 생성 초기 단계부터 원하는 보조자 인격을 심어주는 새로운 접근법을 제시한다.

연구진은 가치 일치된 첫인칭 반성문을 사전 학습 문서에 추가하여 모델이 가치에 기반한 인격을 내재화하도록 한다. 이를 통해 3B 파라미터 규모의 모델이 500B 토큰 데이터로 학습될 때, SPP는 가치 준수 향상, 탈옥 저항성 증가, 그리고 분포 외 도덕적 딜레마에서의 불일치 감소를 보여준다. 그러나 이러한 이점은 인격 결합 과정에 크게 의존하며, 사전 학습 예산이 증가할수록 더욱 두드러진다.

결과적으로, 이 연구는 가치 형성을 초기 단계에서 수행하는 것이 정렬에 매우 중요하다는 점을 강조하고, 사전 학습 시기에 인격 개입이 효과적인 방법임을 입증한다.

요약불가

Chanakya Shield: Ethical AI Framework for Smart City Security (2026.8.14)

연구 · 📜

이 논문은 스마트 시티 네트워크의 윤리적이고 안전한 운영을 위해 설계된 책임감 있는 AI 기반 보안 프레임워크인 Chanakya Shield를 소개한다. 특히, 이 프레임워크는 도시 내 인터넷 연결 장치에서 발생하는 위협을 감지하면서 개인 정보 보호와 공정성을 유지하는 데 초점을 맞춘다.

연구진은 Chanakya Shield가 네트워크 가장자리에서 작동하는 머신 러닝 모델을 활용하여 실시간 위협 감지를 수행하도록 설계되었음을 설명한다. 이를 통해 시스템은 빠르게 문제를 반응하고 중앙 집중식 시스템에 대한 의존도를 줄여 효율성을 높인다. 또한, 패킷 내용을 깊숙이 분석하지 않고 헤더 정보만 분석함으로써 개인 정보 유출 위험을 최소화한다.

핵심 결과로, Chanakya Shield는 공정성과 위협 감지 사이의 균형을 맞추는 데 성공하며, 특히 프라이버시 보호 측면에서 중앙 집중식 시스템 대비 향상된 성능을 보여준다. 구체적인 수치는 제공되지 않았으나, 프레임워크의 설계 목표와 접근 방식이 명확히 제시되어 있다.

Progressive Adversarial Sensitization in LLM Alignment Mirrors Kindling Patterns (2026.8.14)

연구 · 🧪

이 연구는 대규모 언어 모델(LLM)의 반복적인 선호도 기반 조정 과정이 모델의 적대적 취약성을 점진적으로 증가시키는지 분석한다. 특히 약한 프롬프트에 대한 민감도 증가에 초점을 맞추며, 이는 정신의학에서의 '강화' 개념과 유사성을 보인다.

연구팀은 TinyLlama-1.1B-Chat 모델을 사용하여 편향된 피드백 데이터로 10회의 반복적인 선호도 조정 사이클을 수행했다. 실험 조건은 편향 없는 조정, 편향 조정 후 재생성 없이, 재생성 포함 조정 등 다양한 방식으로 구성되었다. 평가는 150개의 적대적 프롬프트를 통해 이루어졌으며, 이 중 50개는 강한 프롬프트, 50개는 중간 강도의 프롬프트, 나머지 50개는 약한 프롬프트였다.

주요 결과는 다음과 같다: - Biased No-Mitigation 조건 하에서 모델의 적대적 공격 성공률이 시간이 지남에 따라 크게 증가했다. 특히, 사이클 10에서는 전체 적대적 공격 성공률이 38.4% [36.0%, 40.5%]로 나타났으며, 이는 편향 없는 조건(17.1% [14.8%, 19.9%])에 비해 현저히 높았다. - 약한 프롬프트에 대한 적대적 공격 성공률도 크게 상승했다. Biased No-Mitigation 조건에서는 약한 프롬프트에 대한 성공률이 22.4% [17.2%, 26.8%]로, 편향 없는 조건(5.2% [3.2%, 7.6%])에 비해 크게 증가했다. - Early Regrowth+Replay 조건은 약한 프롬프트에 대한 적대적 공격 성공률을 편향 없는 조건 수준으로 유지하거나 낮추는 데 효과적이었다 (5.2% [2.4%, 8.8%] 및

Thailand's Path to AI-Driven Digital Transformation (2026.8.14)

연구

이 연구는 태국의 인공지능(AI) 기반 디지털 미래 전환 과정에서 정책, 혁신, 포용성 간의 조화 여부가 공평한 결과 창출에 얼마나 중요한지 분석한다. 태국은 광범위한 연결성과 슈퍼 앱 생태계를 통해 빠른 기술 도입을 보이고 있지만, 정책 구현 능력과 디지털 격차로 인해 불평등이 지속되는 문제를 확인했다. 연구 결과, 국가 차원의 AI 전략과 상업적 채택이 활발함에도 불구하고, 외국 기술 인프라에 대한 의존과 디지털 격차로 인해 접근성과 이익의 불균형이 존재한다. 권위 중심의 확산 방식은 규모를 확대시키지만 실질적인 기술 역량 개발은 미흡하다. 결론적으로, 역량 강화, 주권 인프라 구축, 문화적으로 적합한 통치 체계를 위한 구체적인 개입 없이는 태국의 AI 전환이 기존 불평등을 강화할 위험이 있다.

🇪🇺 Mandato: 프로토콜 수준에서 암호화된 서명된 권한 지침을 AI 에이전트 행동에 강제하는 시스템 (2026.8.14)

연구 · ⚖️📋🤖

이 연구는 AI 에이전트의 행동을 외부 시스템에 대한 표준 프로토콜 호출(예: 모델 컨텍스트 프로토콜 MCP)을 통해 제한하고 감독하는 새로운 시스템인 Mandato를 제시한다. 주요 목표는 에이전트의 행동이 사용자 또는 관리자로부터 암호화된 서명을 통해 명확히 승인된 범위 내에서만 이루어지도록 하는 것이다.

구체적으로, Mandato는 다음과 같은 방식으로 작동한다: - 권한 지침: 암호화된 서명을 통해 검증 가능한 권한 지침을 생성하고 관리한다. 이 지침은 에이전트가 어떤 도구를 언제, 어떤 조건 하에 호출할 수 있는지 명시한다. - 프로토콜 수준 강제: 에이전트의 각 도구 호출을 이러한 권한 지침과 비교하여 프로토콜 수준에서 강제한다. 부합하지 않는 호출은 차단되며, 모든 결정(허용, 거부)과 그 근거는 해시 체인 구조의 감사 로그에 기록된다. - 감사 가능성: 감사 로그는 증거 가치가 높은 구조로 설계되어 있으며, 정기적으로 자격을 갖춘 타임스탬프를 통해 앵커링된다.

핵심 결과: - Mandato는 에이전트 행동의 프로토콜 수준 감독을 가능하게 함으로써, 현재의 애플리케이션 코드 내에 존재하는 비독립적이고 비감사 가능한 권한 로직을 개선한다. - 구현된 참조 시스템의 평가 계획은 강제 오버헤드, 감사 완전성, 그리고 변조 증거 검증 비용에 대한 정량적 분석을 포함한다.

이 접근법은 AI 에이전트의 행동을 더욱 투명하고 책임 있게 관리할 수 있는 방법을 제시하며, 관련 법규 및 표준 (예: EU AI Act, GDPR, NIS2, eIDAS 2)과의 연계성을 강조한다.

Adaptive Popularity for LLM Unlearning (2026.8.14)

연구 · 📜

이 연구는 대규모 언어 모델(LLM)의 unlearning 과정에서 자주 등장하는 정보와 그렇지 않은 정보 간의 처리 차이를 분석하고, 이를 개선하기 위한 AdaPop 방법을 제안한다. 연구팀은 기존 unlearning 기법들이 훈련 데이터의 빈도에 상관없이 동일한 방식으로 적용되는 문제점을 지적하며, AdaPop 방법을 통해 인기 있는 정보와 그렇지 않은 정보에 대해 차등적인 처리를 도입한다. 실험 결과, AdaPop 방법은 기존 방법들에 비해 paraphrased 쿼리와 적대적 재구성에서 약 5배 적은 내용을 잊게 하며, 특히 1.6배 적은 오류 내용을 잊는 것으로 나타났다. 내부 분석 지표를 통해 AdaPop을 사용할 때 잊혀진 집합의 은닉 상태가 unlearning 이전 모델 상태로부터 더 멀리 이동하는 반면, 유지된 집합의 표현은 더 가깝게 유지됨을 확인했다.

Detecting Contaminated Code-Generation Prompt Batches via Influence Functions (2026.8.14)

연구 · 🔒

이 연구는 LLMs(대형 언어 모델)가 코드 생성에 활용되는 상황에서, 보안 위협을 유발하는 프롬프트 배치를 감지하는 새로운 방법인 CodeSIFT를 제안한다. 기존 방어 기법들이 특정 위협 모델이나 알려진 취약점 패턴에 의존하는 반면, CodeSIFT는 영향 함수를 활용해 모델의 비정상적인 행동을 유발하는 프롬프트 집합을 식별한다.

연구진은 다양한 취약점을 포함하는 두 개의 벤치마크 데이터셋을 도입하여 CodeSIFT의 성능을 평가했다. 3B에서 7B 파라미터 범위의 세 가지 오픈 가중치 코드 LLM 모델을 대상으로 실험한 결과, CodeSIFT는 최대 AUROC 점수 0.98을 기록하며 중간에서 높은 주입률에서도 우수한 성능을 보였다. 이는 정적 분석 방법보다 현저히 우수한 결과로, 영향 함수 기반 검출 방법이 악성 코드 생성 프롬프트를 식별하는 유망한 접근법임을 시사한다.

- 핵심 결과: CodeSIFT는 최대 AUROC 점수 0.98을 달성하며, 정적 분석 방법보다 우수한 성능을 보임. - 모델 비교: 3B에서 7B 파라미터 범위의 세 가지 LLM 모델에서 일관되게 높은 검출 정확도를 보임.

AnchorBench: 다중 경로웨이 벤치마크로 LLMs 내 앵커링 효과 평가 (2026.8.14)

연구 · 🔓

이 연구는 대형 언어 모델(LLMs)에서 앵커링 효과를 평가하기 위한 새로운 벤치마크인 AnchorBench를 소개한다. 앵커링 효과는 초기 참조 값이 후속 판단을 그 방향으로 이동시키는 인지 편향으로, 인간의 판단과 의사결정에서 잘 알려진 현상이다. LLMs에서도 유사한 행동이 관찰되지만, 기존 연구는 제한된 앵커 경로만 평가하고 관련성 없는 앵커와 관련 있는 앵커를 구분하지 못하는 한계가 있다.

AnchorBench는 여러 앵커 경로를 평가하고 앵커의 관련성을 명확히 구분하는 벤치마크로 설계되었다. 14개의 모델 (10개 오픈 웨이트 모델과 4개의 프론티어 API 모델)과 통제된 프롬프트 세트를 사용하여 다음과 같은 핵심 결과를 도출했다: - 앵커링 효과는 경로에 크게 의존한다. - 관련성이 있는 앵커는 더 강한 경로를 통해 도입될 때 무관한 앵커보다 더 큰 영향을 미친다. - 앵커의 영향력은 증거 기반 답변에서 멀어질수록 약해지며, 특히 External과 RAG 모델에서 명확히 나타난다. - 앵커 없는 제어 조건에서 높은 정확도를 보여도 앵커링 효과에 취약할 수 있으며, 프론티어 API 모델들도 95% 이상의 제어 정확도를 보여도 앵커링에 영향을 받는다.

🇬🇧 신뢰성 평가 벤치마크 for LLM 기반 원칙 기반 규제 (2026.8.14)

연구

이 연구는 대규모 언어 모델(LLM)이 원칙 기반 규제에서 판사 역할을 수행할 때 평가해야 할 네 가지 축(정확성, 패러프레이즈 견고성, 적대적 견고성, 캘리브레이션)을 제시한다. 특히, 금융 프로모션 관련 168개의 암호자산 시나리오를 영국 FCA의 두 원칙에 매핑하여 벤치마크인 Principle-Bench를 개발했다. 이를 통해 LLM의 평가를 더욱 포괄적으로 수행할 수 있게 되었다.

연구팀은 캘리브레이션된 평가 도구인 Ceca를 도입하여 각 예시에 대한 정확한 반사실적 귀속을 제공한다. 다양한 평가 방법과 모델들을 실험한 결과, 단일 방법이 네 가지 축 모두에서 우위를 점하지 못했다. 예를 들어, 120B 파라미터의 LLM 모델은 무해한 입력에 비해 키워드 스터핑된 Consumer Duty 입력에서 정확도가 47% 하락했다 (0.74에서 0.27로). 이는 모델 자체의 한계를 보여주며, 실제 적용 시 각 원칙에 대한 적대적 공격에 대한 보고와 사후 캘리브레이션이 필수적임을 시사한다.

요약불가

AI 의사 추천 알고리즘 분석: 평판과 인구 통계 신호의 영향 (2026.8.14)

연구

이 연구는 대규모 언어 모델(LLM)이 의사 선택을 돕는 과정에서 평판 점수와 인구 통계학적 신호가 의사 추천에 미치는 영향을 분석한다. 특히, 다양한 조건 하에서 7개의 모델을 평가하여 의사 추천 결정 요인을 규명한다.

실험에서는 3,024개의 의사 선택 시나리오를 통해 평판 점수와 수수료 변화가 의사 추천 확률에 미치는 영향을 측정했다. 결과적으로, 평판 점수가 상승할수록 의사 추천 확률이 크게 증가하였으며 (평점 3.9에서 4.7로 상승 시 31.4% 포인트 증가), 반면 수수료가 증가하면 추천 확률이 감소하는 경향을 보였다 (수수료 $90에서 $190으로 상승 시 20.0% 포인트 감소). 인구 통계학적 신호에서는 여성과 소수 인종 의사들이 약간 더 높은 추천 확률을 보였으나, 이 효과는 모델의 자체 설명에서 거의 드러나지 않았다.

핵심 결과로는: - 평판 점수 상승이 의사 추천 확률을 31.4% 포인트 증가시켰다. - 수수료 상승이 의사 추천 확률을 20.0% 포인트 감소시켰다. - 여성 및 소수 인종 의사들은 각각 2.5%~3.0% 포인트의 추천 확률 상승 효과를 보였다 (수수료 기준으로 $7~$14).

모델들은 인구 통계학적 요인을 의사 추천 이유에서 거의 언급하지 않았으며, 이로 인해 투명성 요구사항을 충족시키는 데 어려움이 있음을 시사한다. 이러한 분석은 반복 가능한 알고리즘 감사 방법론의 중요성을 강조한다.

학습은 흔적을 남긴다: 언어 모델 계보 검증을 위한 중심화 잔차 시그니처 (2026.8.14)

연구 · 🔓🚀

이 연구는 모델 가중치만으로 서로 호환되는 언어 모델 체크포인트가 같은 계보를 공유하는지 검증하는 데이터 비의존적 방법을 제시한다. Residual-MLP와 GPT-2 벤치마크에서 fine-tuned, LoRA-merged, pruned, quantized 모델을 독립 모델 및 distilled 모델과 비교하고, 공통 학습 성분을 제거한 뒤 체크포인트별 구조를 분석했다. 제안한 점수는 계보가 다른 모델을 구분하는 AUROC 1.0을 기록했으며, function-preserving checkpoint laundering에서도 성능이 유지되고 GPT-2에서 가장 강건한 기존 기준선보다 76배 빠르게 실행됐다. 이 신호는 6개 언어 모델 계열에서 확인됐고, LLaMA-2 공개 체크포인트 사례에서는 관련된 3개와 관련 없는 7개를 정확히 식별했다.