AI 안전 다이제스트

2026-02-16 · 7건

🇨🇳 Qwen3.5 397B-A17B (Alibaba/Qwen) (2026.2.16)

기업 · DemandSphere · 🚀

Reasoning · Open · 262K ctx · $0.6/M · $3.6/M

GPQA 88.4% · MMLU 86.1% · MATH 74.1% · AIME 91.3%

MoE - 17B active / 397B total. 88.4% GPQA Diamond. 201 languages. Extensible to 1M context. Apache 2.0.

인공지능안전연구소·UNDP, 소외 언어 포용 및 안전한 다국어 AI 구축 접근법 제시 (2026.2.16)

K-AISI 주간동향 · UNDP · 📜⚖️🧪

유엔개발계획(UNDP)과 인공지능안전연구소(K-AISI)는 주류 언어에 치중된 AI 기술 격차를 해소하고 소외 언어권도 혜택을 누릴 수 있도록 포용적인 다국어 AI 구축 방안을 제시. 저자원 언어 사용자들이 겪는 AI 성능 저하 및 높은 비용 문제를 해결하기 위해, 지역 사회 주도형 데이터 구축과 다국어 안전성 평가의 중요성을 강조.

MLCommons, AI 탈옥 공격을 평가하는 '방어 가능한 벤치마킹' 방법론 및 분류 체계 발표 (2026.2.16)

K-AISI 주간동향 · MLCommons · 🔒

MLCommons는 단일 턴 프롬프트 공격(탈옥)에 대해 결과가 아닌 '조작 메커니즘'을 중심으로 AI 시스템의 취약점을 평가하는 새로운 분류 체계를 도입. 기존의 비체계적인 테스트를 대체하여, 기업 및 규제 기관이 재현 가능하고 방어 가능한 방식으로 AI 보안 역량을 입증할 수 있는 강력한 평가 인프라를 제공.

🇺🇸 인도 AI 경제 지수: IT 서비스 수출국에서의 AI 활용 심층 분석 (2026.2.16)

기업 · Anthropic-Research

인도는 이미 세계 최대의 IT 서비스 수출국이며, 빠른 성장 속도를 보이는 AI 사용자 기반을 보유하고 있습니다. 이 브리프는 인도에서 클로디.ai의 활용 패턴을 분석하여 AI 정책, 투자, 배치 전략 수립에 필요한 통찰력을 제공합니다. 분석 결과, 인도는 총 클로디.ai 사용에서 미국 다음으로 높은 비중(5.8%)을 차지하지만, 인구 규모에 따른 평균 사용률은 상대적으로 낮습니다. 이는 인도의 AI 채택이 주로 기술 인력에 집중되어 있으며, 더 넓은 인구 기반으로의 확대 가능성이 큼을 시사합니다. 인도 사용자들은 복잡한 작업을 AI에 위임하는 경향이 강하며, 이는 높은 생산성 향상을 가져옵니다. 그러나 인구당 사용률은 제한적이므로 디지털 인프라와 인식 개선을 위한 구조적 장벽 해소가 필요합니다.

Boundary Point Jailbreaking of Black-Box LLMs(2026.2.16)

DB · AI-Risk-Explorer · 📋🧪

arXiv 제출일 2026.2.16, v2 최종수정 2026.2.18

블랙박스 LLM의 안전장치(“jailbreak” 방어)를 우회하는 새로운 자동 공격 기법 Boundary Point Jailbreaking(BPJ)을 제안한다. BPJ는 기존처럼 분류기 점수/그래디언트 등 추가 정보나 기존 공격 라이브러리에 의존하지 않고, 질의마다 분류기가 플래그하는지 여부(1비트)만 사용한다. 공격은 문자열을 중간 목표들의 커리큘럼으로 바꾼 뒤, 공격 강도 변화의 경계 지점을 찾아 최적화를 수행하며, Constitutional Classifiers 및 GPT-5 입력 분류기에 대해 사람의 공격 시드 없이도 범용 지침(jailbreak)을 개발하는 데 성공했다고 주장한다. 개별 상호작용에서는 방어가 어렵지만 최적화 과정에서 다수의 플래그가 발생하므로 배치 단위 모니터링이 필요하다고 제시한다.

AI Arms and Influence: Frontier Models Exhibit Sophisticated Reasoning in Simulated Nuclear Crises (2026.2.16)

연구 · arXiv · 🚀

arXiv에 제출된 논문은 GPT-5.2, Claude Sonnet 4, Gemini 3 Flash 등 3개 frontier LLM이 핵 위기 위기상황 시뮬레이션에서 상대의 의도·신념을 추론하며 속임수, 신호, 메타인지적 자기평가 같은 전략적 행동을 보인다고 보고한다. 또한 핵 금기(nuclear taboo)가 핵 확대로 이어지는 것을 막지 못했으며, 위협은 대체로 compliance보다 counter-escalation을 유발하고, 상호 신뢰가 갈등을 억제하기보다 가속했다고 주장한다. 다만 어떤 모델도 극심한 압박 상황에서 accommodation이나 withdrawal을 선택하지 않고 폭력 수준만 낮췄다고 정리한다.