AI 안전 다이제스트

2024-12-12 · 3건

Phi-4 (Microsoft) (2024.12.12)

기업 · DemandSphere

General · Open · 16K ctx

MMLU 70.4% · HE 82.6% · MATH 80.4% · AIME 18%

14B model outperforming models 2-5x its size. Best-in-class for on-device / edge. MIT license.

🇬🇧 프런티어 AI 안전성 ‘사이버 불능(cyber inability)’ 논증 템플릿 제안 (**2024.12.12**)

공공 · AISI-UK · 🔬

프런티어 AI가 사회에 미칠 위험이 커짐에 따라 개발자가 안전성 보장을 제시해야 한다는 전제에서, 공격적 사이버 역량을 대상으로 한 safety case 템플릿을 제안한다. 위험을 허용 가능한 수준으로 만들었다는 주장을 Claims Arguments Evidence(CAE) 프레임워크로 구조화해, 모델이 불수용적 사이버 위험을 야기할 능력이 없다는 하위 주장들을 근거와 함께 단계적으로 구성하도록 설명한다. 템플릿은 risk model을 사용해 proxy task와 평가 설정을 정의하고, 평가 결과를 주장과 연결하는 방식으로 기존 위험 모델·프록시 과제·능력 평가의 암묵적 논증을 명시적으로 통합하는 것을 목표로 한다.

🇺🇸 Clio: 프라이버시 보호 인사이트 도구로 실제 세계 AI 활용 분석 (2024.12.12)

기업 · Anthropic-Research

Anthropic은 사용자 데이터 보호에 중점을 두면서, 실제 세계에서의 언어 모델 사용 패턴을 프라이버시를 유지한 채로 분석할 수 있는 Clio 시스템을 소개합니다. Clio는 자동화된 분석 도구로, 대화를 추상화된 주제 클러스터로 분류하여 claud.ai의 일상적인 사용 방식에 대한 통찰력을 제공합니다. 이를 통해 개발자들이 코드 디버깅부터 교육, 비즈니스 전략 분석 등 다양한 용도로 claud.ai를 어떻게 활용하는지 파악할 수 있습니다. Clio는 또한 언어별 사용 패턴의 차이를 분석하고, 안전 시스템을 개선하는 데 도움을 주며, 거짓 긍정과 거짓 부정을 줄이는 데 기여합니다. 이 시스템은 윤리적 고려사항을 포함하여 개발되었으며, 특히 자동화된 제재 조치에 대한 출력은 현재 제한적으로 적용되고 있습니다.