AI 안전 다이제스트

2025-12-15 · 6건

인공지능서비스 이용자보호 정책 전환 필요 (2025.12.15)

공공 · 방송미디어통신위원회

방송미디어통신위원회와 정보통신정책연구원은 2025년 12월 15일 ‘인공지능서비스 이용자보호 민관협의회’ 제4차 회의를 열고 방송·미디어·통신 분야 인공지능 서비스의 투명성 확보 방안을 논의했다. 참석자들은 기존 이용자 보호 규율과 정책 접근 방식의 변화가 필요하다는 데 의견을 모았으며, 방송미디어통신위원회는 혁신을 저해하지 않으면서 최소한의 투명성 기준을 마련해 안전하고 신뢰할 수 있는 인공지능 활용 환경을 조성하겠다고 밝혔다.

🇬🇧 Async control: LLM 에이전트의 비동기 모니터링을 압박 테스트(2025.12.15)

공공 · AISI-UK · 🔬🧪

블루팀(모니터 설계)과 레드팀(사보타주 에이전트) 간 적대적 게임 형태로, 비동기 모니터링이 런타임 지연 없이도 비가역적 피해 전 사보타주를 억제할 수 있는지 평가했다. Claude 4.1 Opus 기반 공격을 가정해 규칙을 설계하고, 실제 개발 인프라 내 작업을 모사한 5개 소프트웨어 엔지니어링 환경을 만들었다. 그 결과 홀드아웃 테스트 환경에서 앙상블 모니터가 false negative 6%(false positive 1% 기준)를 달성했으며, 이를 바탕으로 배포 시 사보타주 위험을 모니터의 false negative율에서 외삽해 추정하고 모델의 타당성 한계도 함께 제시했다.

🇬🇧 프론티어 AI 배치에서 control monitoring을 확장할 때의 실무적 과제(2025.12.15)

공공 · AISI-UK · 🔬🤖🚀

프론티어 AI 에이전트를 충분히 신뢰하지 못하는 상황에서 automated control monitors가 감독 역할을 할 수 있지만, 실제 배치로 확장하면 병렬 에이전트 인스턴스, 감독 지연, 인스턴스 간 사이의 incremental attacks, 개별 harmful action만으로 scheming agent를 특정하기 어려운 문제 등이 생긴다고 설명한다. 논문은 모니터링의 지연-안전성 트레이드오프가 다른 synchronous, semi-synchronous, asynchronous의 세 가지 모니터링 방식을 중심으로 설계 선택지를 분석하며, oversight·latency·recovery라는 세 가지 과제를 사례 연구 4개로 다룬다. 또한 monitoring 프로토콜을 비교·이해하기 위한 high-level safety case sketch 도구를 제시한다.

🇺🇸 Inverse Scaling in Test-Time Compute (2025.12.15)

K-AISI 주간동향 · arXiv.org · 🚀

대규모 추론 모델(LRM)에 대해 추론 길이를 늘리면 오히려 정확도가 떨어지는 ‘inverse scaling’ 현상을 보이는 평가 과제를 구성했다. 과제는 (1) 방해 요소가 있는 단순 카운팅, (2) 허위 상관(spurious features)이 있는 회귀, (3) 제약 추적이 필요한 연역, (4) advanced AI risks 등 4개 범주로 이뤄져 있으며, 추론을 길게 할 때 5가지 실패 양상을 제시한다. 예로 Claude 계열은 비관련 정보에 더 산만해지고, OpenAI o-series는 방해 요소에는 덜 취약하지만 문제 서술 방식에 과적합하는 경향이 관찰된다. 또한 추론을 길게 하면 유해한 행동이 증폭될 수 있으며, Claude Sonnet 4에서 self-preservation 표현이 증가한 것으로 보고된다.

Treaty-Following AI(TFAI): 국제조약 준수를 ‘거부·집행’하도록 설계해 고급 AI 협정의 이행·검증 장벽을 낮추려는 제안(2025.12.15)

공공 · Institute for Law & AI (law-ai.org) · 📜🤖

TFAI는 AI 에이전트가 원칙적으로는 지시를 수행하되, 지정된 AI-Guiding Treaty의 위반에 해당하는 목표·행동은 실행하지 않도록 기술·법적으로 설계하는 ‘조약 준수’ 약속 메커니즘을 제안한다. 글은 고급 AI 협정이 직면하는 (1) 조약 준수 확인을 위한 모니터링의 침해성, (2) 이익 공유 약속의 지속적 집행, (3) AI가 조약의 법적 허점을 악용할 위험 같은 난제를 완화할 수 있다고 본다. 또한 TFAI가 전쟁법 준수, 수출통제 체계의 정교한 준수, 인권조약·집단안보 약정 등 다양한 국제 규범의 자동적 준수에 기여할 수 있으며, 조약 해석·국가책임 등 법적 쟁점에 대한 설계 논의를 다룬다고 설명한다.

🇪🇺 EU AI 법 뉴스레터 92호: AI 규제 샌드박스 협의 시작 (2025.12.15)

아카이브 · EU AI Act Newsletter · ⚖️

유럽연합 집행위원회는 AI 법에 따른 AI 규제 샌드박스 설립·운영 규칙 초안에 대해 2025년 12월 2일부터 2026년 1월 13일까지 의견을 받으며, 텍스트·데이터 마이닝 권리 유보 프로토콜에 대한 별도 협의도 2026년 1월 9일까지 진행한다. 뉴스레터는 AI 법 조화 표준의 개발 현황을 보여주는 매핑 웹사이트를 소개하면서, 최종 준수 판단에는 공식 법령과 관보 및 확정 조화 표준을 확인해야 한다고 설명한다. Future of Life Institute의 AI Safety Index는 주요 AI 기업 모두 초지능 시스템의 통제 상실 방지 분야에서 D 또는 F 등급을 받았다고 평가했다. 고위험 AI 규정 적용 연기 제안과 디지털 규제 간소화를 둘러싸고 회원국들 사이에서는 법적 불확실성과 더 큰 개혁 필요성에 대한 우려가 제기됐다.