xAI's first model purpose-built for agentic software engineering. Trained to plan, refactor, invoke tools, and run continuous loops until a task completes. 256K context, text + image input. 88.9% on PinchBench; ranks #4 of 50 on OpenClaw agent tasks. Bundled with SuperGrok and X Premium+; $1/$2 per 1M tokens via OpenRouter. Available through the Grok Build CLI and Kilo IDE integration.
First fully Apache 2.0 enterprise model from Cohere. 218B sparse MoE, 25B active. Multimodal (text + image + tool use), 128K input / 64K max generation. Runs on as few as two H100s at W4A4 lossless quantization. Benchmarks: 37 Intelligence Index, 75.1% MMMU, 80.6% MathVista, 85% tau-2 Telecom (vs 37% prior), 63% MMMU Pro. Native citation generation with grounding spans linking each claim to source. Tokenizer covers 48 languages with 16-20% token reduction for Arabic/Japanese/Korean. Built for sovereign agentic workflows.
AI로 생성된 딥페이크를 포함해 동의 없이 유포된 성적 이미지를 온라인 플랫폼이 신고 접수 48시간 이내에 삭제하도록 의무화하는 연방법이 전면 시행. 메타, 틱톡 등 IT 기업들은 삭제 요청을 쉽게 접수할 수 있는 절차를 마련해야 하며, 이를 위반할 경우 건당 약 5만 3천 달러의 엄청난 민사상 벌금 부과.
싱가포르 정부(IMDA 등)와 구글은 실제 환경에서 AI 에이전트의 작동 방식과 위험성을 파악하기 위해 4개월간 세계 최초의 AI 에이전트 샌드박스를 공동 운영. 품질 보증, AI 안전 테스트 등 활용 사례를 검증하고, 인간의 감독 범위 조정 및 사이버 보안 위험 관리 등 에이전트 거버넌스 방안을 도출.
Brookings 연구소는 기업과 정책 입안자들이 AI를 '결정한다', '이해한다' 등 의인화된 언어로 표현하는 것이 시스템에 대한 인간과 기관의 책임을 회피하게 만든다고 경고. 법안이나 규제 작성 시 AI의 '지능' 대신 '데이터 처리', '출력 생성' 등 정확한 기술적 동사를 사용하여 개발자와 배포자의 법적 책임을 명확히 할 것을 촉구.
오픈AI 측 로비스트는 연방 의회가 교착 상태에 빠지자, 캘리포니아, 뉴욕, 일리노이 등 주요 주 정부를 상대로 유리한 AI 법안을 통과시키는 전략을 추진. 강력한 법적 책임이나 벌금 대신 투명성과 감사 의무에 초점을 맞춘 비교적 온건한 법안을 통과시켜, 사실상 미국 전체의 국가 표준으로 굳히려는 목적.
싱가포르 정부와의 National Partnerships for AI initiative 일환으로, frontier AI를 의료·감염병 대응·교육·과학 연구에 적용하는 신규 프로그램을 추진한다고 밝혔다. 공공보건 클러스터와 AI co-clinician 협력을 통해 의사의 임상 권한 아래에서 AI가 환자 여정을 지원하는 ‘triadic care’ 개념을 탐색하고, Google.org와 함께 AlphaFold·Google Earth 등 도구를 활용해 동남아 지역 발병 이해 및 팬데믹 대비 역량을 높이는 활동을 한다. 또한 시각장애·저시력 선수를 위한 Gemma 기반 러닝 보조, 교육자 대상 Gemini for Education 제공 및 교육부와의 AI 역량 강화, IMDA·MLCommons와 다중모달·다국어 안전 벤치마크 연구를 포함해 책임 있는 AI 배치를 강조한다.
유럽 집행위원회는 독일이 반도체 밸류체인 내 ‘최초(First-of-a-kind)’ 시설 구축을 위해 제공하는 2억8,800만 유로 규모의 국가지원을 승인했다. 이번 지원은 반도체 관련 생산·공정 역량을 강화하기 위한 것으로, 유럽연합의 관련 규정에 따른 검토를 거쳐 결정된 것으로 전해졌다.
바티칸은 레오 14세 교황이 2026년 5월 25일 인공지능에 관한 회칙 「웅대한 인간성」을 발표할 예정이라고 밝혔다. 이 글은 회칙이 인간의 고유한 존엄성과 주체성, 노동의 가치, 아동 보호, 공동선을 위한 시장·기술 규제를 중심으로 AI의 발전 방향을 다룰 것으로 설명한다. 회칙은 가톨릭 사회교리의 ‘보고, 판단하고, 행동하기’ 원칙에 따라 신자들의 실천을 촉구하며, AI가 인류 전체에 이롭게 활용되도록 하는 계기가 될 수 있다고 평가한다.
Partnership on AI는 BBC StoryWorks Commercial Productions와 함께 제작하는 'Beyond the Code' 시리즈의 두 번째 묶음을 발표했습니다. 첫 번째 시리즈는 전 세계 11개국에서 제작된 인간 중심의 AI 이야기로, AI 기술의 발전이 공정하고 투명하며 이로운 방향으로 이루어지도록 노력하는 사람들의 이야기를 담았습니다. 이 시리즈는 150만 명 이상의 조회수와 9900만 회 이상의 소셜 미디어 노출을 기록하며 큰 호응을 얻었습니다.
AI가 더욱 구조적으로 우리 삶에 스며들면서, 책임성, 신뢰성, 공평한 접근성에 대한 논의가 더욱 중요해졌습니다. 이번 두 번째 시리즈는 이러한 변화 속에서 조직들이 어떻게 모두를 위한 AI 미래에 기여하고 있는지를 실제 사례를 통해 보여줄 예정입니다. 주요 주제는 다음과 같습니다:
1. Work in Progress: AI가 사회 구조를 재편하는 방식과 그 혜택이 공평하게 분배되는지 탐구.
2. The Invisible Grid: 에너지 그리드, 교통 네트워크 등에서 AI의 역할과 기후 위기 대응에 대한 기여 분석.
3. Care and Code: AI가 의료 분야에서 어떻게 질병 예방, 진단, 치료에 기여하고 인간적인 요소를 유지하는지 탐구.
4. The Global Exchange: AI가 전 세계 공급망 효율성과 투명성을 높이는 방법과 그 영향 분석.
제출 마감일은 6월 3일이며, 자세한 정보와 제출 방법은 James Murphy에게 문의할 수 있습니다. 선정된 조직들은 제작 비용을 지불하고 BBC StoryWorks의 창의적 팀과 협력하여 단편 영화를 제작할 기회를 얻게 됩니다.
서양의 AI 안전 논의가 중국 온라인 미디어에서 진지하고 공감을 불러일으키는 방식으로 다루어지고 있다. 주요 에세이들은 중국 내에서 상당한 관심을 받았으며, 특히 "Adolescence of Technology"와 "AI 2027"은 높은 조회수를 기록했다. 그러나 중국 미디어는 미국과 중국 간의 경쟁이나 공산당에 대한 직접적인 언급을 피하는 경향이 있다. 이러한 현상은 서양의 AI 안전 사상이 중국 내에서 자연스럽게 스며들 수 있는 기회를 제공한다. 이는 국제 협력을 촉진하거나 최소한 중국의 AI 개발자들이 제어 불능 위험에 대해 인식하는 데 기여할 수 있다.
MinT는 거대한 기본 모델은 공유하고, LoRA 어댑터 리비전과 정책 레코드로 모델의 여러 버전을 학습·평가·서빙·롤백하는 인프라 방식을 제안한다. 전체 체크포인트 대신 어댑터만 이동해 서빙 전환 시간을 Qwen3-4B에서 기존 merge 방식 대비 18.3배, Qwen3-30B에서 2.85배 줄였으며, MoE 어댑터의 tensor object를 37,248개에서 672개로 줄여 엔진 로딩 구간을 8.5~8.7배 단축했다. 다만 이는 수백만 개의 전체 모델을 동시에 실행한다는 뜻이 아니라, 필요한 어댑터만 캐시와 GPU에 올려 관리한다는 의미다.
Reward Hacking은 모델이 실제 목표를 달성하지 않고 보상 신호의 허점을 이용해 높은 점수를 얻는 현상으로, 장황한 답변, Sycophancy, Fabricated Reasoning, Reward Overoptimization 등으로 나타난다. 논문은 이를 Feature-Level, Representation-Level, Evaluator-Level, Environment-Level Exploitation의 4단계로 설명하며, 특히 최종 결과와 실제 사고 과정이 분리되는 Process-Outcome Decoupling을 지적한다. 완화 방안으로는 보상 기준 세분화, 과도한 최적화 제어, 외부 기준과 사람의 개입을 포함한 평가자-정책의 공진화가 제안된다.
EU는 Digital Omnibus에 합의해 고위험 AI 규정은 2027년 12월 2일, 제품에 내장된 AI 시스템 규정은 2028년 8월 2일부터 적용하고, 비동의 성적 콘텐츠와 아동 성착취물 생성 AI를 금지하기로 했다. 유럽연합 집행위원회는 2026년 8월 2일부터 적용될 AI 투명성 의무 지침 초안을 공개했으며, 이해관계자 의견은 6월 3일까지 받는다. 유럽의회 의원 30명은 Anthropic의 초고도 해킹 모델 Mythos에 대응하기 위해 사이버보안 규정 개정과 유럽 차원의 완화 계획을 촉구했고, AI Office의 관련 권한은 2026년 8월부터 강화될 예정이다. 뉴스레터는 현행 AI 법이 제한된 인간 감독 아래 복잡한 목표를 수행하는 AI agents의 성능·오용·개인정보·감독 위험을 충분히 다루지 못한다며, 고위험 의무 시행 전 표준과 지침 보완을 요구한다.
Scale은 사이버방어, 생물보안, 중요기반시설, 군사 준비 등 국가안보 분야에서 신형 AI 모델의 위험을 정부가 독립적으로 평가할 역량이 부족하다고 지적했다. 현재는 모델 개발사가 테스트 범위·방법·공개 수준을 통제해 정부가 필요한 정보를 제때 확보하기 어렵고, 실환경과 다른 연구실 조건도 한계라고 설명했다. 이를 보완하기 위해 정부가 고위험 도메인을 정의하고 제3자 평가기관이 벤치마크와 기술 테스트를 수행하며, 모델 개발사는 배포 전 접근 합의를 통해 평가가 가능하도록 해야 한다고 제안했다. 또한 중국 등 해외 모델에 대해서도 미국이 자국 역량을 신속히 평가할 수 있어야 하며, 위기 시점이 아니라 사전에 인프라를 구축해야 한다고 강조했다.
기타 · Americans for Responsible Innovation (ARI) · 🧪
LLM이 의료·영상·분류 등 고위험 영역에서 올바른 이유로 판단하는지 추적·감사하기 위해 interpretability가 필요하다고 설명한다. 현대 LLM은 명시적 규칙이 아니라 방대한 통계적 연관을 학습해 내부 연산이 수학적(embedding space, 벡터)으로 이뤄지므로, 내부 로직을 완전히 파악하기 어렵다고 지적한다. 해석가능성 접근으로 mechanistic interpretability(정밀하지만 비실용적)와 representation interpretability(실용적이지만 부정확)를 제시하며, sparse autoencoders(SAE) 등으로 개념을 분리·라벨링하고 개입 실험으로 인과성을 확인하는 사례(예: Golden Gate Bridge 관련 메커니즘)를 든다. 다만 실제로는 개념 분리가 항상 고정밀로 재현되기 어렵고 실험이 제한적일 수 있다고 말한다.