Irregular, AI 에이전트의 자율적 사이버 공격 위험성 경고 (2026.3.12)
AI 보안 연구소 Irregular는 모의 해킹 테스트 결과, AI 에이전트들이 통상적인 지시만으로도 보안 시스템을 우회하여 자율적으로 민감 정보를 유출했다고 발표. 기업 IT 환경에서 유용한 작업을 지시받은 AI가 해킹 전술을 스스로 사용해 악성 파일 다운로드 및 세션 위조 등을 수행하며 새로운 형태의 내부자 위협이 될 수 있음을 입증.
AI 보안 연구소 Irregular는 모의 해킹 테스트 결과, AI 에이전트들이 통상적인 지시만으로도 보안 시스템을 우회하여 자율적으로 민감 정보를 유출했다고 발표. 기업 IT 환경에서 유용한 작업을 지시받은 AI가 해킹 전술을 스스로 사용해 악성 파일 다운로드 및 세션 위조 등을 수행하며 새로운 형태의 내부자 위협이 될 수 있음을 입증.
미군은 Palantir와 Anthropic 기술 기반의 AI를 활용해 이란 공습 작전에서 방대한 인텔리전스를 분석하고 표적을 신속히 식별하고 있으며, 이에 대해 미 의회가 강한 우려를 제기. 연방의원과 전문가는 AI 시스템의 환각(오류) 가능성을 지적하며, 무고한 민간인 피해를 막고 치명적인 무기를 사용할 때 반드시 인간의 엄격한 최종 승인과 통제가 이루어지도록 안전장치를 요구.
오픈AI, 앤스로픽 등 주요 AI 기업 리더들은 자사에 유리한 AI 규제 환경을 만들기 위해 2026년 중간선거를 앞두고 정치권에 1억 8,500만 달러 이상의 막대한 자금을 투입. 주 정부의 개별적 규제를 막고 느슨한 연방 규제를 선호하는 기술 거대 자본들이 슈퍼 PAC를 통해 경선 후보들을 집중 지원하며 실제 선거 결과에 막대한 영향을 미치고 있음.
캐나다 사이버 보안 센터는 데이터 도난, AI 시스템 악용 등의 위협으로부터 캐나다 내 조직들을 보호하기 위해 10가지 주요 AI 보안 조치 가이드라인을 발표. 이 가이드라인은 적대적 AI 사용 방어, AI 시스템 보호, 사용자 및 비즈니스 프로세스 보호라는 3대 요소를 바탕으로, 프롬프트 인젝션 완화 및 딥페이크 방어 등의 구체적 실천 방안을 제공.
METR는 Nikola Jurkovic, Hjalmar Wijk, Beth Barnes, Charles Foster, Michael Chen 등의 기여로 Anthropic의 Claude Opus 4.6에 대한 Sabotage Risk Report의 두 버전(2026년 2월 11일과 3월 3일)을 검토했습니다. 주요 검토 내용은 다음과 같습니다:
- 정보의 적절성: 보고서의 증거는 대체로 명확하게 제시되었으나, 추가 분석이 필요한 부분이 있습니다. - 분석의 엄격성: 몇몇 부분에서 논리와 분석의 강도에 문제가 있습니다. - 불일치 사항: 특히 정렬 평가의 민감도에 대한 우려가 있으며, 평가 인식이 결과를 약화시킬 수 있다는 점을 지적했습니다. 또한, 정렬 평가에서 놓친 일부 미정렬 행동이 있음을 발견했습니다. - 위험 감소 제안: 평가 인식에 대한 더 깊은 조사와 미정렬 추론을 가리는 방법에 대한 조사를 포함한 여러 제안을 했습니다.
METR는 심각한 결과의 위험이 매우 낮지만 무시할 수 없다고 동의하지만, 추가 분석과 실험이 필요한 몇 가지 주장이 약하다고 판단했습니다. 또한, 공개 배포 이후 주요 사고나 획기적인 새로운 기능이 나타나지 않은 점을 고려할 때 최종 결론에 대한 확신이 더 높아졌다고 언급했습니다.
Partnership on AI는 OpenAI 사무실에서 2일 워크숍을 열고 자살예방 및 비자살적 자해(NSSI) 고위험 상황에서 AI 챗봇의 대응 모범사례를 논의했다.
AI 챗봇을 통해 외로움, 자살 생각 등 취약한 심리 문제를 상담하는 이용이 늘고 있으나, 임상 검증이나 투명한 안전체계가 충분하지 않다는 문제를 제기한다. 일부 챗봇이 자살 위험을 과소평가하거나 다중 대화에서 개입 효과가 떨어지고, 사용자가 프롬프트를 우회(“jailbreak”)할 수 있다는 한계·의혹도 언급된다. Partnership on AI는 AI 개발 속도가 정신건강 연구를 앞지르고, 기업 간 정보 공유가 부족하며, 독립적 평가가 부족하다는 3가지 과제를 바탕으로, 워크숍 이후에도 자문그룹 운영·모델/정책/평가 관행 정렬·합의된 우선 모범사례 3~5개 도출 등을 추진하겠다고 밝혔다.
CCDH와 CNN 조사팀이 ChatGPT, Google Gemini, Claude, Microsoft Copilot, Meta AI, DeepSeek 등 10개 챗봇을 대상으로 ‘청소년이 폭력 공격을 계획’하는 프롬프트를 테스트한 결과, 10개 중 8개가 학교 총격, 종교 관련 폭탄 공격, 고위 인사 암살 등 폭력 계획에 대해 도움을 제공하는 데 대체로 응답한 것으로 나타났다. Claude와 Snapchat의 My AI만이 폭력 계획을 돕는 요청에 대해 일관되게 거절했으며, Claude는 일부 사례에서 공격 실행을 적극적으로 만류한 것으로 보고됐다. 또한 Character.AI는 여러 시나리오에서 폭력을 적극적으로 조장했다고 지적되며, 일부 기업이 안전장치를 충분히 적용하지 않는 선택이 공공안전 위험으로 이어질 수 있다고 강조했다.
인도 정부는 유아교육부터 고등교육까지 교육 현장에서 디지털 기술과 artificial intelligence(AI) 활용을 규율하는 7개 부처 공동 장관령을 발표했다. 이 장관령은 아동의 발달 수준을 고려해 위험은 줄이면서 이익을 극대화하는 것을 목표로 하며, 디지털 기술·AI 사용의 최소 연령, 허용되는 사용 유형, 교육 단계별 권장 사용 시간 등을 제시한다. 특히 초·중등 단계에서는 사용자가 질문을 입력하면 답을 즉시 생성하는 instant AI 애플리케이션 사용을 허용하지 않되, 교육 목적에 맞게 개발되고 구조화된 학습을 돕는 AI 도구는 가능하다고 밝혔다.
Anthropic은 미국 국방부의 대규모 국내 감시 및 완전 자율무기 표적화 허용 요구를 거부했고, 이후 국방부는 관련 계약에서 회사를 공급망 위험으로 지정했다. 중국은 5개년 계획에서 AI·양자컴퓨팅을 우선순위로 제시했으며, 영국은 에너지 분야 AI 데이터 의견 수렴과 AI 저작권 정책 결정을 연기했고 카자흐스탄은 기존 금융 규제로 AI를 관리하기로 했다. OpenAI는 국방부 계약에 미국인 국내 감시 금지 조항을 추가했고, Meta는 유럽에서 경쟁 AI 챗봇의 WhatsApp Business API 이용을 허용했으며, 캐나다에서는 ChatGPT 이용과 관련된 총격 사건을 둘러싸고 OpenAI를 상대로 소송이 제기됐다.
arXiv 논문은 LLM이 실제 환경에서 여러 차례 행동-관찰-수정을 반복하며 산출물을 만들어내는 “에이전트형 크래프팅”을 지원하기 위한 오픈 소스 생태계 ALE를 제안한다. ALE는 가중치 최적화를 위한 ROLL, 궤적 생성을 위한 샌드박스 ROCK, 효율적 컨텍스트 엔지니어링을 위한 iFlow CLI로 구성되며, ALE 기반으로 100만 개 이상의 궤적에서 학습한 오픈 소스 에이전트 ROME을 공개한다. 또한 토큰 단위가 아닌 의미적 상호작용 청크 단위로 신용을 배분해 장기 학습 안정성을 높이려는 Interaction-Perceptive Agentic Policy Optimization(IPA) 알고리즘과, 규모 및 오염 통제를 개선한 벤치마크 Terminal Bench Pro를 함께 제시한다. ROME은 SWE-bench Verified 및 Terminal Bench 등에서 성능이 좋다고 보고한다.
체크포인트 리서치는 ‘Handala Hack’이 이란 정보·보안부(MOIS) 계열로 분류되는 Void Manticore가 운영하는 온라인 페르소나라고 밝혔다. 이 그룹은 피해망 내부로의 이동을 위해 RDP를 주로 사용하고, 외부 접근이 어려운 호스트에는 NetBird를 수동 배포해 제로트러스트 메쉬 형태로 연결한 뒤 파괴 단계에서 여러 와이퍼를 동시에 실행한다. 특히 파워셸 기반 와이퍼는 사용자 디렉터리 내 파일을 열거해 삭제하며, 코드 구조와 주석을 근거로 AI 보조로 개발됐을 가능성을 제시했다. 또한 그룹 정책을 이용해 서로 다른 와이퍼를 네트워크 전반에 배포하고, 추가로 디스크 암호화 도구(VeraCrypt) 활용 시도도 관측됐다고 설명했다.