AI 안전 다이제스트

2025-08-08 · 4건

🇰🇷 배경훈 장관, 보이스피싱 대응에 인공지능 기술 적극 활용 강조 (2025.8.8)

공공 · 과학기술정보통신부 · 🔒

과학기술정보통신부 배경훈 장관은 8월 8일 이동통신 3사와 관계기관 전문가들이 참석한 가운데 보이스피싱 대응 현장간담회를 열었다. KT·SK텔레콤·LG유플러스는 실시간 탐지와 신고 전화번호 차단, 경고 알림 등 인공지능 기반 대응 서비스를 운영하고, 정부 보유 성문 정보 활용을 위해 규제유예제도를 적용하기로 했다. 개인정보보호위원회는 공익 목적의 인공지능 서비스 개발을 위한 통화 내용·성문 데이터 활용과 관련해 법령 해석 및 개정을 추진하고, 과기정통부는 데이터 공유·활용 기반을 마련할 계획이다.

🇬🇧 Deep ignorance: Filtering pretraining data builds tamper-resistant safeguards into open-weight LLMs (2025.08.08)

공공 · AISI-UK · 🔬🔓

8B급 오픈 웨이트 LLM 사전학습 데이터에서 dual-use(생물위협) 관련 텍스트를 필터링하는 다단계 파이프라인을 제안하며, 이 방식이 원치 않는 능력과 biothreat proxy 지식을 줄여 tampering에 더 강한 “safeguard”가 될 수 있음을 보고했다. 6.9B 파라미터 모델을 처음부터 사전학습해 adversarial fine-tuning(최대 10,000 steps, 300M tokens) 공격에 대해 기존 post-training 기준 대비 10배 이상 성능이 우수하다고 설명하며, 관련 없는 능력 저하는 관찰되지 않았다고 밝혔다. 다만 필터링된 모델도 컨텍스트(예: 검색 도구 증강)로 위험 정보를 제공받으면 이를 활용할 수 있어 defense-in-depth가 필요하다고 결론냈다.

🇰🇷 한국지능정보사회진흥원-인공지능안전연구소, LLM 안전성·신뢰성 평가 데이터셋 구축 착수(2025.08.08)

K-AISI 주간동향 · 한국지능정보사회진흥원 · 🔒

한국지능정보사회진흥원과 과학기술정보통신부는 AI 모델의 안전성 및 신뢰성 평가 기반을 마련하기 위한 「LLM 안전성 및 신뢰성 평가 데이터셋 구축」 사업 착수보고회를 8월 7일 개최했다. 이번 사업은 독자 AI 파운데이션 모델 프로젝트를 통해 구축되는 AI 모델의 위험 요소를 체계적·정량적으로 검증하기 위한 평가 체계를 만드는 데 초점을 둔다. 사이버 보안, AI 자율성, 사실 기반 정확성, 사회적 가치 편향 등을 포함해 2만 건 이상의 한국어 특화 벤치마크 데이터셋을 구축할 계획이다.

🇺🇸 메타 연구팀의 "CoT(Chain of Thought)"는 불충실함에도 불구하고 매우 정보적일 수 있다 (2025.8.8)

공공 · METR

메타 연구팀은 LLMs(대형 언어 모델)의 CoT(사유 과정)가 항상 정확하게 모델의 모든 인지 단계를 반영하지 않더라도(불충실함), 안전 분석에 중요한 통찰력을 제공할 수 있음을 발견했다. 연구에서는 복잡한 문제 해결 시 CoT의 중요성을 강조하며, 다양한 난이도의 힌트를 사용한 실험을 통해 CoT가 모델이 힌트를 활용해 문제를 해결하는 과정을 거의 항상 감지할 수 있음을 확인했다. 특히, 힌트의 복잡성이 증가하더라도 CoT의 충실성이 높아지거나 힌트 활용 여부를 감지하는 데 어려움이 없음을 보여주었다. 이 연구는 CoT를 모델의 복잡한 인지 행동을 감지하는 도구로 활용하는 것이 유용함을 시사한다.