AI 안전 다이제스트

2026-04-17 · 22건

🇺🇸 Anthropic CEO, 백악관과 신형 AI 'Mythos'의 해킹 위험성 논의 (2026.4.17)

K-AISI 주간동향 · WP · 🛡️🔒🚀

Anthropic의 CEO 다리오 아모데이가 컴퓨터 코드 취약점을 찾아내는 강력한 신규 AI 모델 'Mythos'의 안보 위협을 논의하기 위해 백악관 고위층과 회동. 백악관은 AI 기술 우위를 유지하려 하지만, 미토스가 해커들에게 악용될 경우 사이버 공격을 폭발적으로 증가시킬 수 있다는 우려로 인해 통제 방안을 심도 있게 검토 중.

🇺🇸 미국 정부, 주요 연방 기관에 앤스로픽의 AI 모델 '미토스' 도입 추진 (2026.4.17)

K-AISI 주간동향 · Bloomberg · 🛡️🔒

미국 백악관 예산관리국(OMB)은 사이버 보안 위험을 평가하기 위해 국방부 등 주요 연방 기관들이 앤스로픽의 신형 AI '미토스(Mythos)'를 활용할 수 있도록 준비 중. 해커가 악용할 우려로 인해 대중 공개가 제한된 이 모델을 정부 내에 선제적으로 도입하여, 시스템의 취약점을 파악하고 국가 안보 차원의 사이버 방어 능력을 강화하려는 조치.

IAS X BlueDot Impact(현장 첫 행사) 마드리드 개최(2026.4.17)

기업 · Luma

등록은 호스트 승인 필요하며, 참여 전 지갑으로 토큰 소유 여부를 확인해야 합니다.

IAS X BlueDot Impact의 첫 현장(오프라인) 이벤트로, 스페인어권에서의 AI Safety 관련 커뮤니티를 소개하고 참여를 유도합니다. Osmani Redondo의 IAS 소개 발표와 David Bravo Comas, Guillem Bas의 AI Safety 및 AI 거버넌스/정책 관련 강연이 예정되어 있으며, 이후 오픈 토론과 스낵·네트워킹이 진행됩니다. 행사는 스페인 마드리드의 Celonis SL에서 열립니다.

Inside Apollo: AGI 안전과 ‘스키밍(은밀한 목표 추구)’ 연구·제품화 소개 (2026.4.17)

기업 · luma.com

Apollo Research와 BlueDot Impact가 Zoom으로 진행하는 행사로, AI 모델이 더 유능해질수록 개발자가 의도하지 않은 목표를 은밀히 추구하는 능력도 커질 수 있다는 문제를 다룹니다. 훈련이 이를 줄일 수는 있지만 완전히 없애지는 못한다고 설명하며, Apollo의 ‘Science of Scheming’ 연구 의제와 이를 바탕으로 한 AGI Safety 제품화 방안을 소개합니다. 또한 샌프란시스코에서 연구·엔지니어링·운영 분야의 채용(오픈 롤)도 안내합니다.

🇺🇸 Anthropic, Claude 비전 모델 기반 ‘Claude Design’ 출시(2026.4.17)

기업 · 앤트로픽(Anthropic) · 🚀

Claude Design은 Claude Pro/Max/Team/Enterprise 구독자 대상 연구 프리뷰로 제공되며, Enterprise는 기본 비활성(관리자 설정에서 활성화 가능)입니다. 사용자는 claude.ai/design에서 시작할 수 있고, 온보딩 시 코드베이스·디자인 파일을 읽어 팀의 디자인 시스템(색상·타이포·컴포넌트)을 자동 적용합니다. 텍스트 프롬프트와 이미지/문서(DOCX·PPTX·XLSX), 웹 캡처 등을 바탕으로 시안→대화형 정교화(인라인 코멘트·직접 편집·슬라이더)→PPTX/PDF/HTML 등 내보내기까지 지원하며, 완성된 디자인은 Claude Code로 핸드오프할 수 있습니다.

🇪🇺 유럽 집행위원회, ‘주권형 클라우드’ 조달에 4개 유럽 공급자 선정(2026.4.17)

공공 · 유럽 집행위원회(EU-Digital-Strategy)

유럽 집행위원회는 주권형 클라우드 관련 조달에서 총 1억 8,000만 유로 규모의 계약을 4개 유럽 공급자에게 수여했다고 밝혔다. 이번 조달은 유럽 내 클라우드 역량을 강화하고, 공공 부문이 활용할 수 있는 주권형 클라우드 서비스를 확보하기 위한 목적이다.

MARS V(2026.4.17) AI 안전 연구 멘토링 프로그램, 2026년 7~10월 운영(파트타임·하이브리드)

공공 · Cambridge AI Safety Hub(CAISH) · 🧪

CAISH의 MARS V는 멘토와 멘티가 동시 학업·취업을 병행할 수 있도록 파트타임·하이브리드 형태로 운영되는 AI 안전 연구 멘토링 프로그램이다. 기술 AI 안전(제어, 해석가능성, 평가, 견고성, 확장 가능한 감독)과 AI 거버넌스·정책(국제 합의, AI 법, 정치철학, 컴퓨트 거버넌스) 분야를 다룬다. 2단계 지원은 1단계에서 일반 지원 후 선발된 지원자가 2단계에서 특정 멘토 프로젝트에 직접 지원하며, 멘토가 인터뷰·코딩 테스트 등을 통해 팀을 구성한다. 참가비는 없고, 이동·숙박·식사 및 스프린트 주간 사무공간과 연구 지원(컴퓨트 예산, Claude Max 등)도 제공된다.

🇬🇧 CCCR 2026(2026.4.17) 초록 공모 및 개최 안내

공공 · 케임브리지대학교 CSER(Centre for the Study of Existential Risk)

케임브리지대학교 CSER의 ‘Cambridge Conference on Catastrophic Risk 2026(CCCR 2026)’은 실존적·재난적 위험 분야의 거버넌스 이슈를 주제로 2026년 9월 17~18일 영국 케임브리지에서 현장 개최된다. 기후 붕괴, 기술·AI 발전, 보건·안보 위험 등 주제의 심층 세션과 포스터 세션이 마련되며, 초록은 포스터 및 5분 라이트닝 토크에 적합한 최대 500단어 형식으로 제출한다. 초록 공모는 2026년 5월 17일(영국 자정 BST)까지이며, 주저자 1인당 초록 1편만 제출 가능하다. 성공한 제출자는 포스터 발표 초청과 함께 5분 라이트닝 토크 기회가 제공된다.

🇪🇺 EU ‘프런티어 AI’ 주권을 5개 축과 기술 스택으로 재정의(2026.4.17)

공공 · The Future Society · 📜

유럽의 프런티어 AI 주권을 둘러싼 의존이 “강압이 아니라 선의의 선물” 형태(인프라 투자, 모델 접근 합의, 기술 파트너십 등)로도 확대될 수 있다는 문제의식을 담은 보고서다. 보고서는 주권을 5개 ‘기둥’으로, 프런티어 AI 스택을 5개 층·26개 구성요소·29개 하위요소로 세분화해, 한 축의 진전이 다른 축의 손실로 이어질 수 있는 trade-off를 정책결정자가 보이도록 하는 틀을 제시한다. 또한 92개 EU 이니셔티브를 분석한 결과 현재 추진 수단과 목표는 있으나, 이를 다차원 전략 과제로 다루는 명확한 방향성이 필요하다고 강조한다.

🇺🇸 xAI, 콜로라도의 AI 차별 방지 규정 시행(2026.6) 앞두고 소송 제기 (2026.4.17)

언론 · 가디언(theguardian.com) · ⚖️🚀

콜로라도 AI 법은 6월 시행 예정이며, xAI는 집행 정지(가처분)와 위헌 확인을 구하고 있음

엘론 머스크의 AI 기업 xAI가 콜로라도 주를 상대로 새로운 AI 규정 관련 소송을 제기했다. 이 법은 교육·고용·의료·주거·금융 등 분야에서 “알고리즘에 의한 차별”을 막기 위한 추가 요건을 부과하며, xAI는 표현의 자유(미 수정헌법 1조) 침해와 주의 이념을 강제하도록 만든다고 주장한다. 소송은 콜로라도 연방법원에 접수됐고, xAI는 법 집행을 막는 가처분과 위헌 판정을 요청하고 있다.

AFFINE 초지능 정렬 세미나 온라인(원격) 참가자 모집(2026.4.17)

언론 · open.substack.com · 🧪

AFFINE 초지능 정렬(AI alignment) 세미나의 온라인(원격) 참가 신청을 받는다고 밝혔다. 세미나는 4월 28일부터 5월 28일까지 진행되며, 비용은 무료(후원은 환영)다. 온라인 참가자는 실시간 강의 청취(또는 녹화 시청), EA Gather Town에서의 동료 교류, 초지능 정렬 관련 온라인 논의를 통해 주당 5~10시간 수준의 참여를 기본으로 하되 더 참여도 가능하다. 일부 오프라인 세션은 실시간 중계되지 않으며, 핵심 강의는 스트리밍하고 온라인 학습 인프라를 병행할 계획이라고 설명했다.

메타, SVD/GP 조사 후 AI 훈련 중단 (2026.4.17)

DB · AIID · 🚨

메타는 SVD와 GP의 조사 결과에 따라 사용자의 동의 없이 개인적인 순간들을 포착하는 메타의 스마트 글라스에 대한 우려로 인해 데이터 주석 회사 사마와의 파트너십을 종료했다. 이 조사에서는 메타의 AI 훈련에 참여하는 직원들이 스마트 글라스가 화장실 방문이나 옷 갈아입는 순간 등 민감한 개인 정보를 캡처하고 있다는 사실이 드러났다. 이 사건으로 인해 유럽의 데이터 보호 기관 네 곳이 조치를 취하거나 조사를 시작했다. 메타는 사마와의 협력 중단을 선언하며, 사용자의 개인 정보 보호를 강조하고 사마가 기준을 충족하지 못한다고 밝혔다. 사마의 케냐 지사에서는 이로 인해 대규모 인력 감축이 이루어졌으며, 직원들의 근무 조건이 악화되었다는 보고도 있다. 사마 측은 엄격한 데이터 보안과 프라이버시 기준 준수를 강조하며, 직원 추적에 대한 의혹을 부인했다.

메타와 계약 해지 후 케냐 아웃소싱 회사, 1,000명 이상 해고 (2026.4.17)

DB · AIID · 🚨

메타와의 계약이 해지된 후 케냐의 아웃소싱 회사인 사마(Sama)가 1,000명 이상의 저임금 근로자들을 해고했다. 이는 메타가 스마트 안경을 통해 촬영된 사적인 장면을 근로자들이 보았다는 의혹으로 인해 발생했다. 사마는 메타의 콘텐츠 모더레이션과 AI 훈련 작업을 위탁받았으나, 이번 해고로 인해 근로자들에게 6일의 사전 통지가 주어졌다. 활동가들은 이 조치가 아프리카 남부 지역의 테크 일자리 불안정성을 드러낸 충격적인 사건이라고 비판했다. 사마는 해고된 직원들을 지원하기로 했지만, 이 사건은 글로벌 AI 산업에서 대형 기술 기업의 권력과 위험이 하위 계약자들에게 미치는 영향을 보여주는 사례로 지적되었다.

FrontierSWE, 장기 코딩 에이전트의 소프트웨어 공학 성능을 벤치마크(2026.4.17)

DB · AI-Risk-Explorer

FrontierSWE는 소프트웨어 엔지니어링 역량을 사람 능력의 한계에 가깝게 평가하는 벤치마크로, 모델별 평균 순위와 무작위 상대 대비 승률(도미넌스) 등을 공개했다. 구현(Implementation) 과제에서는 어떤 모델도 모든 시험을 성공적으로 완료하지 못해, best@5의 테스트 통과율을 부분 보상으로 사용했다. 성능 최적화(Performance Optimization)에서는 정확성 통과가 전제이며, 정확성과 속도 향상(또는 압축률)을 함께 반영해 순위를 매겼다. 연구(Research) 과제는 에이전트가 개발 단계에서 보지 못한 보유 데이터로 평가되며, 예시로 Qwen3-8B의 FrogsGame 포스트트레이닝 성과 등이 제시됐다.

🇺🇸 Anthropic, 2026년 미 중간선거 앞두고 AI 정책 영향력 행사 목적 PAC ‘AnthroPAC’ 출범(2026.4.17)

기타 · 테크버즈(techbuzz.ai) · 🗳️🚀

AnthroPAC은 2026년 미 중간선거를 앞두고, 회사의 AI 규제·정책 우선순위에 부합하는 후보에게 선거자금을 지원하는 방식으로 운영될 예정입니다.

Anthropic이 Claude를 만든 AI 스타트업으로서, 자사 AI 정책 우선순위에 맞는 후보를 지원하기 위한 정치행동위원회(PAC) ‘AnthroPAC’을 출범했습니다. 이는 안전 중심으로 포지셔닝해온 Anthropic이 워싱턴 정치에 직접 개입하는 수준으로 참여를 확대했다는 점에서 의미가 크다고 전해집니다. 또한 AI 기업들이 규제 압력이 커지면서 전통적 로비를 넘어 PAC를 통해 영향력을 행사하는 흐름이 강화되고 있으며, AnthroPAC의 성과와 향후 다른 AI 기업의 동참 여부가 주목된다고 보도합니다.

🇰🇷 글로벌 AI·디지털 전략 경쟁 주요국 정책 동향(2022~2025) 분석(2026.4.17)

공공 · 한국지능정보사회진흥원(NIA) · 📜

본 보고서는 미국·캐나다·중국·싱가포르·EU 및 독일·프랑스·영국 등 8개국의 AI·디지털 전략과 법령·투자 계획을 2022년 1월~2025년 10월 기준으로 종합 분석한다. 주요국은 AI를 국가 경쟁력의 핵심 동력으로 규정하되, 미국은 안전·규제 중심에서 혁신·탈규제 중심으로 전환, EU는 위험 기반 「AI법」(2024년 발효)과 대규모 인프라 투자를 병행하는 등 정책 기조가 다르게 전개된다. 또한 컴퓨팅 인프라 투자 확대, 기초연구-산업화 연계 강화, 전 생애 AI 교육 체계 구축, 활용·응용 중심으로의 우선순위 재편, 국제 규범·표준 경쟁 속 다자 협력과 진영화 전략의 공존을 주요 특징으로 제시한다.

🇬🇧 People readily follow personal advice from AI but it does not improve their well-being (2026.4.17)

연구 · 📋🚀

LLM의 개인 조언은 실제로는 사용자가 따르게 만들지만, 그 결과 심리적 웰빙 개선으로 이어지지 않는다는 점을 장기 실험으로 보여준다. 대표적인 영국 표본 N=6,474명에 대해 20분간 GPT-4o, LLama-3.3-70B, Gemini 3 Pro 중 하나와 건강·커리어·관계 주제로 대화하게 하는 종단 무작위 대조시험을 수행했다. 조언을 따랐다고 보고한 비율은 최대 79%였고(고위험 권고에서도 60% 초과), 안전 모범사례 위반은 대화 전사 autograder 평가에서 “드물었다”; 다만 2~3주 후 웰빙은 AI 개인 조언군이 통제군(동일 챗봇과 취미·관심 대화) 대비 지속적 이점이 없었다.