🇬🇧 LLM 에이전트 위해 ‘control safety case’ 구성 방안 제시 (2025.1.28)
LLM agents가 더 큰 해를 끼칠 수 있어 개발자가 monitoring 같은 control 조치로 안전성을 정당화할 수 있다고 보고, ‘control safety case’라는 구조화된 주장을 제안한다. 가상의 내부 LLM 에이전트가 민감정보를 유출하지 못한다는 사례를 들어, red team이 배포 환경을 대리해 데이터 exfiltration을 유도하는 ‘control evaluation’에 기반해 통제의 유효성과 개발자의 보수적 성능 외삽을 핵심 주장으로 둔다. 글은 위험한 수준의 LLM 에이전트를 실제 배포해도 안전하다는 더 구체적 논증을 향한 단계라고 설명한다.