AI 안전 다이제스트

2025-08-21 · 7건

AI 개방성: 정책입안자를 위한 입문서 (2025.8.21)

공공 · 경제협력개발기구(OECD) · 🔓

이 보고서는 인공지능의 개방성 개념과 관련 용어, 개방성의 다양한 수준을 설명한다. 소프트웨어에서 유래한 ‘오픈소스’라는 용어만으로는 AI의 복잡한 특성을 충분히 설명하기 어렵다고 분석한다. 실험 데이터를 바탕으로 오픈 웨이트 파운데이션 모델의 동향과 잠재적 이점·위험을 검토하고, 생성형 AI 파운데이션 모델의 개방성과 책임 있는 거버넌스 간 균형을 위한 정책 논의를 지원한다.

앤서픽, 고등교육 자문위원회 및 AI 유창성 과정 출시 (2025.8.21)

기업 · 앤서픽 · 📜

앤서픽은 고등교육 분야에서 AI의 윤리적이고 책임감 있는 도입을 지원하기 위해 고등교육 자문위원회와 AI 유창성 과정을 출시했습니다. 자문위원회는 교육 기술과 학습 과학 분야의 전문가들로 구성되어 있으며, 클라우데(Claude)의 교육 분야 적용을 안내합니다. 또한 세 가지 AI 유창성 과정은 교육자와 학생들이 실질적이고 책임감 있는 AI 기술을 배울 수 있도록 설계되었습니다. 이 과정들은 크리에이티브 커먼즈 라이선스 하에 공개되어 있어 모든 기관이 수정 및 활용할 수 있습니다. 이러한 노력은 미래의 AI 교육 환경을 공동으로 창조하는 데 초점을 맞추고 있습니다.

요약불가

🇺🇸 Anthropic와 정부 기관의 협력으로 AI 핵 안전 장치 개발 (2025.8.21)

기업 · Anthropic · 🧪🚀

Anthropic는 미국 에너지부(DOE)의 국립핵안보행정처(NNSA)와 협력하여 AI 모델이 핵 관련 위험한 기술 지식을 제공하는 것을 방지하기 위한 안전장치를 개발하고 있습니다. 이 파트너십을 통해 개발된 핵 관련 내용 분류기는 핵 관련 대화를 위험한 것과 무해한 것으로 96%의 정확도로 구분합니다. 이 시스템은 이미 Claude 모델 트래픽에서 테스트 중이며 초기 데이터는 효과적인 성능을 보여주고 있습니다. 이러한 공공-민간 파트너십은 AI 모델의 신뢰성과 안전성을 높이는 데 기여하며, Anthropic는 이 접근법을 Frontier Model Forum을 통해 공유하여 다른 AI 개발자들이 유사한 안전장치를 구현하는 데 도움을 주고자 합니다.

🇺🇸 Anthropic와 정부 기관의 협력으로 AI 핵 안전 보장 기술 개발 (2025.8.21)

기업 · Anthropic-Research

Anthropic은 미국 에너지부(DOE)의 국립핵안보행정처(NNSA)와 협력하여 AI 모델이 핵 관련 위험한 기술 지식을 제공하는 것을 방지하기 위한 기술을 개발하고 있습니다. 이 파트너십을 통해 개발된 핵 관련 내용 분류기는 96%의 정확도를 보여주며, 이는 핵 관련 우려 사항과 무해한 대화를 구분하는 데 사용됩니다. 이 접근법은 AI 모델의 안전성을 향상시키고, 민간 기업과 정부 기관 간의 협력 모델을 제시하여 다른 AI 개발자들에게도 적용 가능하도록 공유될 예정입니다.

🇺🇸 AI 모델의 핵 안전 장치 개발 (2025.8.21)

기업 · Anthropic-Research · 🧪

Anthropic은 미국 에너지부(DOE)의 국립핵안보행정처(NNSA)와 협력하여 AI 모델이 핵 관련 위험한 기술 지식을 제공하는 것을 방지하기 위한 핵 안전 장치를 개발하고 있습니다. 공동 개발한 분류기는 핵 관련 대화를 위험한 것과 무해한 것으로 96%의 정확도로 구분합니다. 이 시스템은 실제 사용자 대화에서도 효과적으로 작동하며, 핵 관련 교육, 의료, 연구 토론을 잘못 분류하지 않는 것으로 나타났습니다. 이 파트너십은 공공-민간 협력의 힘을 보여주며, 다른 AI 기업들이 유사한 안전 장치를 구현하는 데 참고할 수 있는 모델을 제시합니다.

🇫🇷🇰🇷 AI 위험 논의 국제정상회의가 규범 형성에 기여했지만, 프랑스 회의처럼 의제가 분산되면 ‘가드레일’ 구축은 약해질 수 있음 (2025.8.21)

기타 · globaldispatches.org · 📜⚖️🚀

Bletchley Park(2023)에서 시작된 AI 안전·보안 위험 논의 정상회의는 이후 서울(2024), 파리(2025)로 이어졌고, 2026년 인도에서 다음 회의가 예정돼 있다. 인터뷰에 따르면 이 과정은 대화의 분위기를 바꾸고 영국의 AI Safety Institute 설립, 미국 등 유사 기관 확산에 영향을 줬으며, 특히 서울에서 기업들이 한 자발적 약속이 EU의 frontier AI 규제 논의(예: AI Act)로 이어지는 데 기반이 됐다고 본다. 다만 프랑스 회의는 안전·보안 의제를 상대적으로 축소하고 AI 거버넌스 참여 확대, 접근성, 일자리 등 사회 이슈에 더 초점을 둬 ‘가드레일’ 구축 관점에서는 보완이 필요하다는 평가가 나온다.

🇪🇺🇺🇸 EU AI Act가 기본권 보호와 혁신 촉진의 균형을 이뤘는지 점검한 학술서(2025.08.21)

기타 · IRDT Schriften des IRDT (유니 트리어)

유럽연합의 AI Act를 기본권 중심 관점에서 비판적으로 분석한 책으로, 2024년 Digital Law Institute Trier 연례 컨퍼런스에서 나온 논문들을 엮었다. 금지되는 AI 관행, 위험 기반 규제모델, 데이터 거버넌스와 human oversight 등 핵심 의무를 다루며, 혁신을 억누르지 않으면서 기본권을 보호하는 규율 방식이 가능한지 살핀다. 또한 미국과 아시아의 AI 규제 접근을 비교해 글로벌 기술 규제에 대한 함의를 정리한다. (기술 오류로 ISBN이 교체되었으며 새 ISBN은 9783565013197)