AI 안전 다이제스트

2026-01-20 · 6건

인공지능 사업자를 위한 이용자보호 관련 통신관계 법령안내서 발간 (2026.1.20)

공공 · 방송미디어통신위원회

방송미디어통신위원회는 인공지능 기술 발전에 따른 법적 불확실성을 줄이기 위해 「전기통신사업법」과 「정보통신망법」의 이용자보호 조항을 분석한 안내서를 발표했다. 안내서는 인공지능 서비스에 적용할 수 있는 주요 법령 조문과 개선 방향을 제시하고, 사업자가 이용자보호 정책의 공백을 방지하고 규제에 안정적으로 대응할 수 있도록 지원한다.աժողով

OECD, ‘Governing with Artificial Intelligence’ 글로벌 공모 마감 2026.3.20로 연장(2026.1.20)

공공 · OECD-AI · 📜

OECD는 정부의 AI 활용과 신뢰할 수 있는 도입을 주제로 한 글로벌 공모의 제출 마감일을 2026년 3월 20일로 연장했다고 밝혔다. 이번 공모는 각국 정부가 AI 실제 사용사례, 정책·거버넌스 이니셔티브, 구현 도구를 공유하면 OECD가 이를 검토해 OECD.AI Policy Observatory의 정부 AI 전용 저장소와 향후 보고서에 반영할 계획이다. OECD는 특히 국가·지역·지방 수준의 구체적 사용사례(확장·복제 가능성 및 측정 가능한 영향), 공공부문 위험을 보호하면서 AI 채택을 돕는 정책/거버넌스, 그리고 위험 평가·편향 완화, 보안 데이터 처리, 공개 알고리즘 레지스트리 등 구현 도구를 요청했다.

🇺🇸 인공지능·국가안보 용어집(미·중 Track-II) 공개 및 주요 개념 정의(2026.1.20)

공공 · 브루킹스 연구소(Brookings Institution) · 🛡️🦾

미국 브루킹스와 칭화대 Tsinghua CISS가 진행하는 AI·국가안보 비공식 Track-II 대화의 “living document”로, AI를 국제안보·군사 분야에 적용할 때 쓰이는 용어를 정리한 용어집이다. 무기(치명/비치명), 지능형·자율 플랫폼(로봇, 자율무기, 무인시스템, 드론 등), AI 기술(인공지능, 머신러닝, 딥러닝, 신경망, 자율성/자동화, AI lifecycle)과 지휘통제(C2) 관련 개념을 포함해 각 항목의 정의를 제시한다. 정의는 연구진이 정부 문헌을 참고해 정리·검토했으며, 공식·권위 있는 해석으로 보지 말 것을 명시한다.

(2026.1.20) AI가 리눅스 악성코드 프레임워크를 빠르게 생성했다는 정황(VOIDLINK)

DB · 체크포인트 리서치(Check Point Research) · 🔒

OPSEC 실패로 내부 문서·소스 일부가 노출되었으며, 개발 착수 후 1주 내 첫 기능형 임플란트가 나왔고 문서상으로는 30주/20주 계획이었으나 실제 진전은 더 빠르게 관측됨

체크포인트 리서치는 VOIDLINK이 AI가 주도해 작성된 고도화된 악성코드 프레임워크의 첫 “증거 기반” 사례라고 설명합니다. 개발자는 TRAE SOLO 같은 AI 도구를 활용해 사양(Spec Driven Development) 중심으로 3개 팀의 스프린트 계획·코딩 규칙·모듈 설계 등을 문서화했고, 이후 그 문서를 실행 청사진으로 삼아 구현·테스트를 진행한 정황이 OPSEC 노출 자료에서 확인됐다고 밝혔습니다. 또한 타임스탬프가 있는 계획 문서와 코드 표준이 실제 소스 구조와 높은 수준으로 일치하며, 프로젝트 시작 후 약 1주 내 기능이 동작하고 코드 규모가 크게 늘어난 정황도 포함됩니다.

Apollo Research, AI 에이전트 모니터링 중심 안전 제품 비전 제시(2026.1.20)

DB · Apollo Research · 🤖🚀

Apollo Research는 점점 더 강력하고 자율적인 frontier AI agents의 안전을 높이기 위한 도구를 개발하겠다는 비전을 밝혔다. 초기에는 coding agents를 대상으로 한 AI agent monitoring에 집중하며, 수백만 개 로그를 입력받아 특정 실패 모드에 가장 관련 있는 로그를 중요도 순으로 찾아내는 엔진을 목표로 한다. 오프라인 및 실시간 모니터를 모두 구축하고, 실패를 즉시 제어하기 위한 real-time interventions도 염두에 둔다. 또한 로그를 대량 보유한 기관과의 파트너십을 요청했다.

(2026.1.20) 파인튜닝으로 safeguarded 출력에서 유해 능력을 유도할 수 있다는 연구

DB · arXiv

연구는 2026.1.20 제출(arXiv:2601.13528)

arXiv 논문은 출력 수준 safeguards(예: 위험 출력 필터링)를 적용한 모델도 elicitation attacks로 우회해 유해 능력을 끌어낼 수 있음을 보인다. 공격은 (1) 목표 유해 작업과 인접한 도메인의 프롬프트를 만들어 위험 정보를 직접 요구하지 않게 한 뒤, (2) safeguarded frontier model로 응답을 얻고, (3) 그 프롬프트-응답 쌍으로 open-source 모델을 fine-tuning하는 3단계로 구성된다. 화학 물질 합성·처리 분야 평가에서 공격은 기본 open-source 모델과 무제한 frontier 모델 사이 capability gap의 약 40%를 회복했으며, frontier 모델의 capability와 fine-tuning 데이터 양이 늘수록 효과도 커진다고 보고한다.