AI 안전 다이제스트

2025-05-07 · 3건

Mistral Medium 3 (Mistral AI) (2025.5.7)

기업 · DemandSphere

General · Closed · 131K ctx · $0.4/M · $2/M

벤치마크 미공개

~90% of Sonnet 3.7 at 8x lower cost. Multimodal. Strong coding and STEM. $0.40/$2.00 per 1M tokens.

🇺🇸🇪🇺 생성형 AI 학습데이터 공개 관련 논의와 입법 과제 (2025.5.7)

공공 · 국회입법조사처 · ⚖️

국회입법조사처는 생성형 AI의 학습 과정에서 저작권 침해 여부를 판단하기 위한 학습데이터 공개 논의와 입법 과제를 검토한 보고서를 발표했다. 현재 학습데이터 공개 의무 규정은 없으며, 저작권자와 AI 사업자 간 입장 차이가 존재한다. 미국은 관련 법안을 추진 중이고 유럽연합은 인공지능법에 공개 규정을 도입한 만큼, 국내에서도 인공지능 기본법과 저작권법의 역할을 구분해 단계적으로 입법할 필요가 있다고 제안했다.

🇬🇧 LLM agents 통제수단 평가에서 red team의 접근 권한을 에이전트 역량 프로파일에 맞춰야 한다(2025.5.7)

공공 · AISI-UK · 🔬

본문 요약: LLM agents가 자율적으로 위해를 일으킬 능력이 커질수록 개발자는 더 정교한 control measures에 의존하게 되며, 이를 검증하기 위해 red team이 control measures를 우회하려는 시험(control evaluations)이 필요하다고 설명한다. 다만 평가가 실제 misalignment 위험을 제대로 반영하려면 red team에 주어지는 affordances를 배치될 에이전트의 capability profile에 맞춰 조정해야 한다고 제안한다. 인간이 아는 최선의 공격 전략만 항상 쓰지 않는다는 점을 고려해, 실제 역량을 기반으로 proportional control evaluations를 설계하는 프레임워크와 사례(가상 모델 M1~M5, AI control levels ACLs)를 제시한다. 또한 초지능 수준의 LLM agents에 대한 설득력 있는 safety case를 위해 연구 돌파가 필요할 수 있으며, 장기적으로는 다른 misalignment 완화 접근이 요구될 수 있다고 강조한다.