AI 안전 다이제스트

2026-07-04 · 6건

🇨🇳 중국, ‘인터넷 정보 서비스’ 관리조치 초안 대대적 개정…플랫폼·AI 규율 중심(2026.7.4)

언론 · Geopolitechs

중국 사이버관리당국(CAC)은 2026년 7월 3일 「인터넷 정보 서비스 관리조치」 개정(시안)을 공고하고 의견수렴을 진행했다. 기존 2000년 27개 조항 중심 체계에서 2026년 시안은 94개 조항으로 확대되며, 규제 권한은 CAC가 주도하고 MIIT는 산업·시장접근 등으로 역할을 분담하는 방향이 명확해졌다. 또한 ICP(인터넷 콘텐츠) 승인·운영 기준을 통합하고, 해외 운영 서비스도 중국 내 이용자 대상 여부와 영향 등에 따라 적용될 수 있도록 외국 관련 조항을 강화했으며, ‘대형 인터넷 플랫폼’과 생성형 AI 등 ‘지능형 정보서비스’에 대한 별도 장 신설 및 책임을 기업과 개인(책임자)에 이중으로 묻는 규정도 포함됐다.

🇰🇷 잠재공간 첫 오프라인 AI 윤리 이벤트 개최 (2026.7.4)

언론 · AI-Ethics-KR · 📜

잠재공간(JJGG)이 주최하는 첫 오프라인 이벤트에 AI 윤리 레터 구독자들을 초대합니다. 이 이벤트는 발레리 비치 감독의 다큐멘터리 <Ghost In The Machine> 상영과 토론을 통해 AI 기술의 사회적·정치적 맥락을 탐구하고 인간의 주체성을 고민하는 자리입니다. 상영회는 2026년 7월 25일 오후 2시 30분부터 5시 30분까지 진행되며, 한국어 자막을 제공합니다. 장소는 서울특별시 용산구에 위치한 후암거실이며 참가비는 15,000원입니다. 이 이벤트는 소규모 인원으로 진행되어 깊이 있는 대화를 나눌 수 있는 기회를 제공합니다.

🇺🇸🇨🇳 알리바바, 7월 10일부터 직원의 Claude Code 사용 금지(2026.7.4)

DB · 테크크런치(TechCrunch) · 🚀

알리바바는 직원들이 앤트로픽(Anthropic)의 프로그래밍 도구 Claude Code를 사용하지 못하게 하고, 대신 자사 Qoder 도구를 쓰도록 지시한 것으로 전해졌다. 앤트로픽은 중국 기업 및 관련 소유 주체의 모델 사용을 이미 금지해 왔으며, 이를 우회하는 경로를 막기 위해 계정 남용 방지·distillation(다른 모델 출력으로 학습되는 방식) 대응 실험을 진행해왔다고 설명했다. 그럼에도 알리바바는 Claude Code를 고위험 소프트웨어로 분류한 것으로 보도됐다.

PACE Cuts the Cost of Evaluating AI Agent Capabilities (2026.7.4)

DB · Hugging Face Papers (arXiv 2607.02032) · 🤖

PACE는 비용이 큰 agentic LLM 벤치마크 성능을, 비싼 전체 평가를 대신할 수 있도록 소수의 atomic 평가 인스턴스로 예측하는 프레임워크다. SWE-Bench·GAIA 등 4개 agentic 벤치마크에 대해 proxy benchmark인 PACE-Bench를 구성·평가했으며, 14개 모델 대상 실험에서 leave-one-out cross-validation 기준 MAE 4% 미만, Spearman 상관 0.80 이상, 모델 순위 정확도 약 85%를 보고했다. 또한 전체 agentic 평가 비용의 1% 미만 수준으로 추정이 가능하다고 제시했다.

Self-improvement을 위한 ‘harness engineering’ 핵심 패턴과 최적화 방향 제시 (기사 게재일: 2026.7.4)

기타 · lilianweng.github.io

AI의 재귀적 self-improvement(RSI)를 위해서는 모델 자체를 곧장 가중치까지 재작성하는 것보다, 모델을 둘러싼 실행/계획/도구 사용/컨텍스트·아티팩트 저장·평가를 담당하는 harness가 중요하다고 설명한다. harness는 workflow automation, 파일 시스템을 persistent memory로 활용, 병렬 sub-agent와 백엔드 작업 관리 같은 설계 패턴을 통해 더 긴 작업 지평에서 안정적으로 반복·검증하도록 돕는다. 또한 컨텍스트가 무한히 길어지는 문제를 줄이기 위해 ACE(Agentic Context Engineering)나 MCE(Meta Context Engineering)처럼 ‘문맥을 프롬프트 길이로 늘리는 방식’이 아니라 구조화·업데이트 규칙/메타-최적화로 관리하는 접근을 다룬다.

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification (2026.7.4)

연구 · 🔒

LLM agent의 외부 도구 사용이 만드는 복잡한 안전 위험을, 확장 비용이 낮은 자동화된 시험 체계로 검증하는 방법을 제안한다. Vera는 문헌 기반 탐색으로 emerging risks를 안전 위험·공격 방법·tool execution environment의 택소노미로 구조화하고, 택소노미 차원을 조합해 safety goal·초기 상태·관찰 가능한 증거에 기반한 deterministic verification predicate를 포함한 executable safety case를 생성한다. 이어 isolated sandbox에서 control agent가 런타임 관찰로 multi-turn 상호작용을 이끌며, verifiers는 model self-report가 아니라 환경 상태와 tool-call evidence로 결과를 판정한다. Vera-Bench(1600개 안전 케이스, 124개 위험 범주, 3개 실행 설정) 평가에서 production 4개 agent 프레임워크( OpenClaw, Hermes, Codex, Claude Code )의 average attack success rate가 multi-channel attacks에서 93.9%에 도달해 취약점이 크고 광범위함을 보여준다.