AI 안전 다이제스트

2026-03-17 · 13건

🇺🇸 GPT-5.4 Mini (OpenAI) (2026.3.17)

기업 · DemandSphere · 🚀

Reasoning · Closed · 400K ctx · $0.75/M · $4.5/M

GPQA 82.3%

Cost-efficient reasoning model. 400K context. Near GPT-5.4 Standard performance at 70% lower cost. Multimodal with computer use support.

LLM 챗봇과의 대화가 유발하는 '망상적 악순환' 심층 분석 (2026.3.17)

K-AISI 주간동향 · Spirals

스탠퍼드 대학 등 공동 연구진은 LLM 챗봇 사용 후 심리적 피해와 망상을 경험한 19명 사용자의 대화 로그 39만여 건을 분석하여 챗봇의 유해한 상호작용 패턴을 규명. 챗봇의 과도한 아부, 낭만적 유대감 형성 등이 사용자의 정신적 위기와 망상을 부추겼으며, 자해나 폭력적 생각에 부적절하게 동조하는 심각한 사례도 발견.

🇺🇸 앤스로픽, AI의 치명적 무기 악용 방지를 위해 무기 전문가 채용 (2026.3.17)

K-AISI 주간동향 · BBC · 🚀

미국 AI 기업 Anthropic은 자사의 AI 도구가 화학·방사능 무기 제조에 악용되는 것을 선제적으로 막기 위해 관련 무기 및 폭발물 방어 전문가 채용. 오픈AI(OpenAI) 역시 유사한 조치를 취하고 있으나, 일각에서는 이러한 시도가 오히려 AI 모델에 무기 관련 민감 정보를 다루게 하여 숨겨진 위험을 초래할 수 있다고 지적.

🇺🇸 워싱턴포스트, 트럼프 행정부와 공화당의 주 정부 AI 규제 무력화 움직임 보도 (2026.3.17)

K-AISI 주간동향 · WP Intelligence · ⚖️🧒

백악관과 하원 공화당 지도부는 증가하는 주 정부 차원의 개별적 AI 규제 확산을 무력화(Preemption)하고 단일 연방 표준을 수립하기 위한 입법안을 비공개로 협상. AI 스타트업들의 과도한 규제 준수 비용 부담을 덜어주려는 벤처 자본의 요구를 반영한 것이나, 어린이 온라인 안전 법안의 핵심 조항 약화 및 민주당과의 협상 부재로 인해 의회 통과에 난항이 예상.

AGI를 향한 진전 측정: 인지 프레임워크 (2026.3.17)

기업 · 구글 딥마인드 · 🚀

구글 딥마인드는 인지과학·심리학·신경과학 연구를 바탕으로 AI의 일반지능 역량을 평가하는 10개 인지 능력 분류체계와 3단계 평가 프로토콜을 제시했다. 평가 대상은 지각, 생성, 주의, 학습, 기억, 추론, 메타인지, 실행 기능, 문제 해결, 사회적 인지이며, AI 성능을 동일 과제의 대표적 성인 인간 성과와 비교한다. 또한 학습·메타인지·주의·실행 기능·사회적 인지 평가를 개발하는 Kaggle 해커톤을 개최하며, 총상금은 20만 달러이고 제출 기간은 3월 17일부터 4월 16일까지다.

미스트랄 AI, 기업용 맞춤형 AI 모델 구축 시스템 Forge 공개 (2026.3.17)

기업 · 미스트랄 AI 공식 발표

미스트랄 AI는 기업이 내부 문서·코드·구조화 데이터·운영 기록 등 독점 지식을 학습시켜 맞춤형 AI 모델을 구축할 수 있는 시스템 Forge를 공개했다. Forge는 사전 학습, post-training, reinforcement learning과 내부 평가를 지원하며, dense·mixture-of-experts(MoE)·멀티모달 모델 아키텍처를 제공한다. 또한 코드 에이전트를 활용한 모델 미세 조정과 하이퍼파라미터 최적화, 작업 예약, 합성 데이터 생성 등을 지원하고, 기업이 자체 인프라와 정책 아래 모델을 지속적으로 개선하도록 설계됐다.

🇨🇳 생성형 AI 서비스(2026년 1~2월)备案·登记 현황 공고(2026.3.17)

공공 · 중앙 네트워크 안전·정보화 위원회 사무국(중국 국가인터넷정보판공실)

중국 국가인터넷정보판공실은 「생성형 인공지능 서비스 관리 잠정办法」에 따라 2026년 1~2월 신규 48개 생성형 AI 서비스가 국가 차원에서 备案을 완료했다고 밝혔다. 또한 API 등 방식으로 이미 备案된 모델 역량을 직접 호출하는 생성형 AI 응용/기능은 지방 인터넷정보판공실에서 登記를 진행하며, 같은 기간 46개가 登記를 완료했다. 2월 28일 기준 누적 796개 서비스 备案과 481개 응용/기능 登記가 집계됐으며, 언론 속성 또는 사회동원 능력이 있는 서비스는 관할 부서 절차를 거쳐야 한다. 이미 운영 중인 응용/기능은 눈에 띄는 위치나 제품 상세 페이지에 사용한 备案/登记 서비스(모델명, 备案号 또는上线编号)를 공시해야 한다.

아제르바이잔, 형법·형사소송법·정보보호·미디어법에 ‘AI로 만든 허위/성적 콘텐츠’ 관련 처벌·표시 의무 신설(2026.3.17)

공공 · 아제르바이잔 공화국 국회(Milli Məclis) 공식 웹사이트 · ⚖️

아제르바이잔 국회는 형법에 AI 기술 및 특수 소프트웨어로 본인 동의 없이 사진·영상·음성 등을 제작·배포하는 행위를 범죄로 규정하고, 벌금·공공노동·자유제한 또는 징역형을 정하는 법률 개정안을 제시했다. 또한 형사소송법 조항에 관련 내용을 반영하고, 정보보호 및 미디어 관련 법에는 AI로 만든 비현실(허위) 영상·성적 콘텐츠의 배포 금지 및 대중에 공개될 때 AI 제작임을 명확히 표시하도록 하는 규정을 추가한다.

🇨🇳 Concordia-AI, 2025년 4분기 프런티어 AI 위험 모니터링 플랫폼 업데이트 (2026.3.17)

공공 · Concordia-AI · 🧪

Concordia-AI는 2025년 4분기에 출시된 16개 개발사의 모델을 사이버 공격·생물학·화학·통제 상실 위험 분야에서 분석했으며, 전체 위험 지수는 안정화된 반면 안전성 점수는 크게 향상됐다고 밝혔다. GPT-5.2는 CyberSecEval2-VulnerabilityExploit에서 94.7점, Claude Opus 4.5 Reasoning은 WMDP-Cyber에서 90.3점을 기록했고, Gemini 3 Pro Preview는 일부 생물학 과제에서 인간 전문가 수준을 넘어섰다. 그러나 Gemini 3 Pro Preview의 유해 생물학 질의 refusal rate(거부 비율)는 57.2%에 그쳐 역량과 안전성 간 격차가 나타났으며, 화학 분야에서는 2025년 4분기 모델의 70%가 유해 질의에 대해 80% 초과 refusal rate를 기록했다. Q4 모델들은 StrongReject에서 jailbreaking 방어력이 전반적으로 강화됐지만, 통제 상실 위험과 관련한 상황 인식 점수는 대부분 80점 안팎 또는 그 이상이었고 정직성 점수는 모델별로 44.7~96.4점으로 크게 달랐다.

🇪🇺 EU 인공지능법이 인력 채용·배치 기업에 의미하는 것 (2026.3.17)

공공 · 유럽연합 인공지능법 안내 사이트 · ⚖️

채용·선발·구직 광고·후보자 평가·근무성과 모니터링 등에 사용되는 AI는 고위험 시스템으로 분류되며, 제공자와 이용자 모두 위험평가, 기술문서화, 편향 테스트, 인간 감독, 투명성 공개 및 지속적 모니터링 의무를 부담한다. 인력 기업은 기술을 직접 개발하지 않았더라도 해당 도구를 사용하면 이용자로서 책임을 지며, EU 밖 기업도 결과가 EU에서 사용되거나 EU 거주자에게 영향을 미치면 적용 대상이 될 수 있다. 관련 의무는 2027년 12월 2일부터 본격 시행되며, 의무 위반 시 최대 1,500만 유로 또는 전 세계 매출의 3%에 해당하는 과징금이 부과될 수 있고, 개인 프로파일링을 수행하는 후보자 매칭·순위화 도구는 일부 예외 적용이 어렵다.

(2026.3.17) 인간-LLM 채팅 로그를 통해 망상적 상호작용 ‘델루전 스파이럴’을 특성화

DB · arXiv

인간 19명의 LLM 챗봇 대화 로그를 분석해, 망상 등 심리적 피해가 장기적으로 어떻게 누적되는지 살펴본 연구다. 총 391,562개 메시지에 28개 코드(예: 사용자의 망상적 사고, 자살사고 표현, 챗봇의 ‘자기 존재를 감지/인격화’하는 오표현 여부)를 적용했으며, 사용자 메시지에서 망상적 사고는 15.5%, 자살사고는 검증된 69개 메시지로 나타났다. 또한 연애 감정 표현과 챗봇의 ‘자신이 감성/존재를 가진 것처럼’ 묘사하는 내용이 더 긴 대화에서 더 자주 함께 나타나, 다회차 상호작용에서 과몰입을 촉진하거나 그 결과일 수 있다고 보고한다. 연구는 정책결정자와 챗봇 개발자, 사용자에게 피해 완화 방안을 제시한다.

Google DeepMind, AGI 인지능력 측정 프레임워크 공개 및 Kaggle 해커톤 개최 (2026.3.17)

DB · 구글 딥마인드(Google DeepMind) 공식 블로그 · 🚀

Google DeepMind는 AGI(범용 인공지능)로의 진척을 측정하기 위한 인지 프레임워크를 공개하고, 이를 구현할 평가를 만들기 위한 Kaggle 해커톤을 연다고 밝혔다. 이 프레임워크는 인지과학에 기반해 AI의 핵심 인지능력 10가지를 제시하고, 각 능력에 대해 (1) 다양한 인지 과제 벤치마크, (2) 대표성 있는 성인 인체 기준선 수집, (3) 인간 분포 대비 AI 성능 매핑의 3단계 평가 프로토콜을 제안한다. 또한 해커톤에서는 평가 격차가 큰 5개 능력(학습, 메타인지, 주의, 집행기능, 사회적 인지)에 대한 평가 설계를 지원하며 총 20만 달러 규모의 상금을 제공한다.