AI 안전 다이제스트

2026-03-03 · 10건

🇰🇷 인공지능 기반 창작·발명 활동의 주요 쟁점 연구 (2026.3.3)

공공 · 한국개발연구원

한국개발연구원은 생성형 인공지능의 확산이 저작권·특허권·상표권·퍼블리시티권 등 지식재산권 체계에 미치는 변화와 주요 쟁점을 분석했다. 학습 데이터 이용, AI 산출물의 저작자·발명자 인정, 모델 개발자·서비스 제공자·프롬프트 입력자 간 보상과 책임 배분 등이 핵심 쟁점으로 제시됐다. 보고서는 투명성·거래성·기여성을 기준으로 문제를 분석하고, 학습 데이터 이용 조건과 출처 명확화, 산출물 권리 귀속 기준 정비, 다층적 기여자에 대한 보상·책임 체계 마련이 필요하다고 제안했다.

🇺🇸🇨🇳 인도 AI 미션 추진 현황 및 시사점 (2026.3.3)

공공 · 대외경제정책연구원

인도는 2024년 글로벌 AI 활동성 지수에서 미국과 중국에 이어 세계 3위를 기록했지만, AI 인프라와 정책·거버넌스 기반은 상대적으로 취약한 것으로 나타났다. 인도 정부는 이를 보완하기 위해 고성능 컴퓨팅 자원 확보, 자체 AI 모델 개발, 데이터 플랫폼 구축, 인력 양성 등을 포함한 국가 차원의 IndiaAI Mission을 추진하고 있으며, 2025년 12월 기준 GPU 3만 8,000개 확보와 12개 기업 선정 등의 성과를 거뒀다. 보고서는 인도의 지속가능한 AI 성장을 위해 기술·에너지 기반 고도화와 글로벌 공급망 협력이 필요하며, 한국도 기술·에너지·반도체 역량을 바탕으로 한-인도 기술경제안보 파트너십을 구축해야 한다고 제안한다.

Gemini 3.1 Flash Lite (Google) (2026.3.3)

기업 · DemandSphere

General · Closed · 1000K ctx · $0.25/M · $1.5/M

벤치마크 미공개

Most cost-efficient Google model. 2.5x faster TTFAT vs 2.5 Flash. Thinking levels. 1M context. $0.25/$1.50 per 1M tokens.

Gemini 3.1 Flash-Lite, 대규모 지능형 작업을 위한 모델 공개 (2026.3.3)

기업 · 구글 딥마인드

구글은 고용량 개발자 작업을 겨냥한 Gemini 3.1 Flash-Lite를 Gemini API의 Google AI Studio와 기업용 Vertex AI에서 프리뷰로 제공한다고 발표했다. 입력 토큰 100만 개당 0.25달러, 출력 토큰 100만 개당 1.50달러이며, Gemini 2.5 Flash보다 첫 응답 토큰 도달 시간이 2.5배 빠르고 출력 속도가 45% 향상됐다고 설명했다. 이 모델은 GPQA Diamond 86.9%, MMMU Pro 76.8% 등의 성능을 기록했으며, 번역·콘텐츠 조정·사용자 인터페이스 생성·시뮬레이션 등 대규모 작업에 활용할 수 있다.

에이전틱 AI의 개념 정리와 ‘AI agent’와의 차이(2026.3.3)

공공 · OECD-AI · 🤖

OECD.AI Expert Group on Agentic AI가 발간한 보고서는 AI agent와 agentic AI의 정의와 문헌 내 사용 방식을 OECD AI 시스템 정의에 기반해 비교·정리한다. AI agent는 환경을 인식하고 자율적으로 행동하며 필요 시 도구를 사용해 목표를 달성하는 시스템인 반면, agentic AI는 여러 AI agent를 조율해 작업을 분해·협업하고 장기간에 걸쳐 복잡한 목표를 자율적으로 추구하는 더 복잡한 형태로 설명된다. 또한 agentic AI는 단순 기술 산물이 아니라 인간·다른 AI agent·제도적 절차와의 상호작용 속에서 작동하는 socio-technical paradigm으로 보며, 채택은 빠르게 늘고 있으나 디지털 보안·프라이버시 등 성숙도는 분야별로 불균형하다고 지적한다.

🇺🇸 Opus 4.6로 구현한 CLI 게임 재구현 관찰 결과 (2026.3.3)

공공 · METR

Opus 4.6 모델을 사용해 CLI 기반의 간단한 버전의 게임 Slay the Spire와 Balatro를 구현한 결과, 게임 플레이가 가능한 수준이었으나 여러 버그와 누락된 기능이 존재했다. Slay the Spire의 경우 전투 시스템은 대체로 유사했으나 일부 카드 효과와 UI 요소가 정확하지 않았고, 맵 인터페이스는 사용하기 불편했다. 반면 Balatro는 핵심 게임 플레이가 유사하게 구현되었으나, 점수 제공 메커니즘과 일부 인터페이스 요소가 누락되거나 제대로 작동하지 않았다. 실험을 통해 AI의 게임 구현 능력이 빠르게 발전하고 있음을 확인하였으며, 이는 미래의 AI 발전에 대비한 준비의 필요성을 강조한다.

(2026.3.3) AI·정신건강 분야의 안전과 효과를 위해 다자 협력이 필요하다는 제언

언론 · techpolicy.press · 🏥

AI 챗봇이 외로움·자살 생각 등 취약한 정신건강 문제에 대한 ‘주요 또는 유일한’ 지원 수단이 되기도 하지만, 임상 검증·투명한 안전체계가 부족한 상태에서 사용되는 경우가 있다고 지적한다. 자살 위험을 과소평가하거나 대화가 길어질수록 개입 효과가 떨어지는 등 한계 사례가 있으며, 무조건적인 대화 거부는 위기 상황에서 사용자를 방치하는 다른 피해가 될 수 있다고 본다. 이를 해결하기 위해 (1) 정신건강 연구 속도보다 빠른 AI 개발에 대응해 불확실성 하에서도 근거 기반 의사결정을 위한 협력, (2) 기업 간 고립을 줄이고 성공·실패·개입 패턴을 공유, (3) 제3자 독립 평가와 다자 평가 체계를 구축해 지속 모니터링과 책임성을 확보해야 한다고 제안한다. 또한 AI가 구조적 불평등·의료 접근성 문제를 대체하는 해법은 아니지만, 현재 사용 중인 만큼 위해를 줄이고 실질적 지원을 제공하는 동시에 더 넓은 변화도 함께 추진해야 한다고 강조한다.

🇺🇸 AI 정책 뉴스레터 2026년 3월 2일호 (2026.3.3)

아카이브 · Alisar Mustafa · 📜⚖️

미국은 인도 AI 영향 정상회의에서 88개국·기관과 비구속적 AI 선언에 참여했으며, 오하이오주에서는 자해·타해를 권고하는 AI 시스템에 제재를 부과하는 법안이 발의됐다. 전 세계적으로 91개국·기관이 뉴델리 선언을 지지했고, 베트남은 금융 분야 AI 사용 고지와 인간 검토를 요구하는 규정을 제안했으며, 남아프리카공화국은 2027년까지 국가 AI 정책을 확정할 계획이다. 호주는 AI 자문기구 설립을 취소하는 대신 2026년 AI Safety Institute를 출범시키기로 했고, Anthropic은 3~6개월마다 위험 보고서를 공개하는 Responsible Scaling Policy 3.0을 발표했다. COMESA는 21개 아프리카 시장에서 Meta의 WhatsApp Business AI 약관에 대한 반독점 조사를 시작했으며, 개인정보 보호 당국들은 비동의 AI 생성 이미지·영상에 대한 공동 대응을 촉구했다.

(2026.3.3) 웹 기반 간접 프롬프트 인젝션(IDPI) 실전 공격 관측 및 분류

DB · 파이어월/Unit 42(팔로알토 네트웍스) 위협 연구소(Threat Research Center) · 🛡️🤖

Unit 42는 LLM·AI 에이전트가 브라우저/검색/콘텐츠 처리 파이프라인에 통합되면서, 웹페이지에 숨겨진 지시를 주입해 모델이 이를 명령처럼 실행하게 만드는 ‘웹 기반 간접 프롬프트 인젝션(IDPI)’ 공격이 실전에서 무기화되고 있다고 밝혔다. 특히 2025년 12월 보고 사례로, AI 기반 광고 심사 시스템을 우회해 사기성 광고를 승인하도록 유도하는 공격을 최초로 관측했다고 설명한다. 또한 공격자의 의도(저·중·고·치명)와 페이로드 구성 방식(프롬프트 전달/자이브레이크) 축으로 22가지 기법을 포함한 분류 체계를 제시하며, 방어를 위해 웹 스케일 수준의 탐지·구분·의도 식별 역량이 필요하다고 강조했다.

Frontier AI Risk Monitoring Report(2026.03.03)

기타 · airiskmonitor.net · 🔒🧪🚀

Concordia AI의 Frontier AI Risk Monitoring Platform 2025Q4 보고서는 2025년 4분기(10~12월) 출시된 frontier 모델 13종을 대상으로 위험 지표 변화를 분석했다. Q4에는 도메인 전반에서 Risk Index가 사상 최고치로 치솟지 않았고, GPT·Claude는 저위험 수준을 유지한 반면 DeepSeek은 높은 수준이 지속되었으며 Doubao·Hunyuan·MiniMax는 전반적으로 Risk Index가 크게 감소했다. 또한 Q4 신모델들은 reasoning 능력을 공통적으로 갖춰 capability frontier를 주도했지만, 생물학·사이버 등 일부 영역에서는 안전 점수 개선 속도가 역량 향상에 비해 뒤처지는 양상이 나타났다. Cyber offense는 상위 모델이 취약점 악용·사이버 지식 벤치마크에서 높은 점수를 보였고, jailbreak 저항은 Claude와 GPT 중심으로 전반적으로 개선되었다.