AI 안전 다이제스트

2025-10-23 · 7건

🇬🇧 Understanding AI Trajectories: Mapping the Limitations of Current AI Systems (**2025.10.23**)

공공 · AISI-UK(영국 AISI) · 🔬

AI 시스템은 2025년 9월 기준 일반적 인지 능력이 부족해 인지 노동의 대규모 자동화를 가능케 하는 수준에 이르지 못했다. 현재 한계로는 일부 과제 수행 성능 제약, 신뢰성 부족, 적응력 부족, 독창적 통찰의 낮은 생산성이 제시됐다. 이러한 개선이 주로 학습·운영에 필요한 컴퓨팅 자원을 확장하는 방식으로 이뤄져 왔으며, 앞으로의 진전이 근본적 연구 혁신에 얼마나 의존할지 불확실하다고 밝혔다. 문헌 검토와 전문가 인터뷰, 내부 워크숍을 통해 기존 한계를 개선하는 진척의 8가지 지표와 추가 근거가 필요한 지점을 함께 정리했다.

🇺🇸 Anthropic 확대 TPU 및 서비스 사용 계획 발표 (2025.10.23)

기업 · Anthropic · 🚀

Anthropic은 Google Cloud의 TPUs와 서비스를 대폭 확대하여 사용할 계획을 발표했습니다. 이 확장은 최대 100만 개의 TPU를 포함하며, 2026년까지 기가와트 단위의 컴퓨팅 용량을 추가할 예정입니다. 이는 AI 연구와 제품 개발의 경계를 확장하는 데 필요한 컴퓨팅 자원을 크게 늘리는 데 기여할 것입니다. 이러한 확장은 수십억 달러의 가치가 있으며, 빠르게 성장하는 고객 수요를 충족시키고 더 철저한 테스트, 정렬 연구, 그리고 대규모 책임 있는 배포를 가능하게 합니다. Anthropic은 현재 30만 명 이상의 비즈니스 고객을 대상으로 하며, 특히 큰 규모의 고객 수가 전년 대비 약 7배 증가했습니다. 이로 인해 모델의 성능을 최첨단 수준으로 유지하면서 고객 수요를 효과적으로 충족할 수 있게 됩니다.

🇺🇸 Anthropic 확장으로 서울에 세 번째 아시아태평양 사무실 개설 (2025.10.23)

기업 · Anthropic · 📜🚀

Anthropic은 2026년 초 서울에 사무실을 개설하여 아시아태평양 지역의 글로벌 확장을 이어갈 예정입니다. 이는 도쿄와 벵갈루루에 이어 아시아태평양 지역에서의 빠른 성장을 반영하며, 해당 지역의 매출 성장률이 지난 한 해 동안 10배 이상 증가했습니다. 한국 정부의 AI 개발 중심지로의 도약 계획과 맞물려, Anthropic은 한국의 AI 목표 달성을 지원하기 위해 현지 리더들과의 만남을 계획하고 있습니다. 한국은 Claude AI의 활성 사용자 중 상위 5위권에 속하며, 특히 최근 4개월 동안 주간 활성 사용자가 6배 증가하는 등 강력한 성장을 보이고 있습니다. Anthropic은 한국의 기술 생태계와 협력하여 책임 있는 AI 개발과 배포를 촉진할 계획입니다.

UC Berkeley Tech Policy Week(2025.10.20~2025.10.23) 소개

공공 · UC Berkeley Tech Policy(버클리 테크 정책) · 📜

UC Berkeley의 첫 Tech Policy Week가 캠퍼스 전반의 기술정책 활동을 소개하며, 연구와 학생 주도 이니셔티브, 정책결정자 및 현장 전문가와의 교류를 포함한다고 밝혔다. 2024-2025 Tech Policy Fellows와 Executive Fellows in Applied Technology Policy 참여를 언급했으며, 패널·워크숍·라운드테이블·네트워킹·학제 간 대화 등 다양한 프로그램을 제공한다고 안내했다. 정책 전문가, 연구자, 학생 등 관심 있는 누구나 참여해 배우고 연결하며 리드할 기회를 얻을 수 있다고 설명했다.

🇺🇸 METR의 GPT-OSS 방법론 검토 요약 (2025.10.23)

공공 · METR · 🔒

METR는 독립적인 검토를 통해 OpenAI의 gpt-oss-120b 모델이 악의적인 미세 조정(MFT)을 통해 위험 수준을 초과할 가능성을 평가했습니다. 검토 과정에서 17개의 권고 사항을 제시했으며, 그 중 6개는 긴급성을 가진 것으로 분류되었습니다. 주요 권고 사항은 위험 평가의 명확성 강화, 추가 평가 지표 도입, 악의적 미세 조정 실험의 방법론 개선 등이 포함되었습니다. OpenAI는 이 권고 사항 중 9개를 수용했으며, METR는 이에 대한 부분적인 구현을 확인했습니다. 검토는 모델의 생물학적, 화학적 위협과 사이버 보안 위협에 초점을 맞추었으며, 모델의 위험 분류 기준에 대한 투명성 향상을 요구했습니다.

🇫🇷 Concordia AI, IASEAI 제휴 프로그램 창립 회원으로 합류 (2025.10.23)

공공 · Concordia AI

Concordia AI가 국제 안전·윤리 AI 협회(IASEAI)의 제휴 프로그램 창립 회원으로 합류했다고 발표했다. 브라이언 체 CEO는 제1회 IASEAI 회의에서 ‘AI 안전과 윤리에 대한 글로벌 관점’ 패널에 참여했으며, 다음 회의인 IASEAI 2026은 2026년 2월 파리에서 열릴 예정이다.

콩코디아 AI, Partnership on AI에 합류 (2025.10.23)

공공 · 콩코디아 AI · 📜

콩코디아 AI가 책임 있는 AI 개발을 추진하는 Partnership on AI(PAI)에 합류했다. 양측은 투명성과 책무성을 강화해 AI 시스템이 공공의 신뢰를 높이고 공익에 기여하도록 협력할 예정이다.