AI 안전 다이제스트

2025-08-13 · 4건

🇺🇸 AI 통합이 ‘사고·오남용’ 너머의 구조적 위험을 낳는 메커니즘을 복합계 시스템 관점에서 분석(2025.8.13)

K-AISI 주간동향 · RAND

AI가 사회·정치·경제의 핵심 기능에 깊이 내재될수록, 단순한 시스템 실패나 malicious misuse 같은 근접 위협을 넘어서는 emergent한 시스템 수준 위험이 나타날 수 있다고 논문은 설명한다. structural risk를 선행 구조적 원인, 선행 AI 시스템 원인, 해로운 피드백 루프로 분류하고, 통제되지 않은 AI 개발이 신뢰를 흔들고 권력 비대칭을 이동시키며 의사결정 agency를 약화시킬 수 있음을 제시한다. 이를 예측·거버넌스하기 위해 scenario mapping, simulation, exploratory foresight를 포함한 방법론적 의제를 제안하고, 제도적 회복력과 적응형 거버넌스 전략을 위한 정책 권고로 마무리한다.

호주 인권위원장 “AI가 인종차별·성차별 악화” 경고 (2025.8.13)

K-AISI 주간동향 · 가디언(theguardian.com)

호주 인권위원장 로레인 핀레이는 AI의 생산성 이익을 추구하더라도 차별이 심화되지 않도록 적절한 규제가 필요하다고 경고했다. 그는 AI가 어떤 데이터로 학습되는지 불투명하면 편향이 무엇인지 파악하기 어렵고, 알고리즘 편향과 자동화 편향이 결합될 경우 차별이 더 고착될 위험이 있다고 밝혔다. 한편 노동당 내부에서는 데이터 공개 범위와 AI 규제 방식에 대한 이견이 있으며, eSafety 커미셔너도 생성형 AI의 학습·배포 과정 불투명성이 유해한 편향을 확대할 수 있다고 지적했다.

미시간 상원, 성적 deepfake 금지안 통과(2025.8.13)

K-AISI 주간동향 · Bridge Michigan · ⚖️🎭

성적 deepfake(실존 인물을 성적으로 허위 묘사한 사진·영상) 제작·배포를 범죄화하는 2개 법안이 미시간 상원을 만장일치·초당적으로 통과했다. 1회 위반은 경범죄로 최대 1년 징역 또는 최대 3,000달러 벌금(또는 병과), 재범은 중범죄로 최대 3년 징역 및 5,000달러 벌금이 적용된다. 법안은 기술기업에 대한 면책 조항이 포함돼 하원에서 변경사항을 다시 표결해야 하며, 이후 주지사 그레천 휘트머 서명 절차로 넘어갈 수 있다. 한편 하원·상원에선 성인물 접근 전 연령확인을 요구하는 별도 법안도 논의 중이며, 가을에 상원 버전 청문회가 예상된다고 전했다.

🇺🇸 AI 에이전트의 실제 소프트웨어 작업 수행 능력과 자동 채점 방법 간의 차이 분석 (2025.8.13)

공공 · METR · 🤖

본 연구는 AI 에이전트가 오픈소스 소프트웨어 작업을 수행하는 능력을 평가하며, 특히 자동 채점 방법과 수동 검토 방법 간의 차이를 분석한다. Claude 3.7 Sonnet 기반 에이전트는 주어진 테스트 케이스를 통과하는 데 성공률이 38%로 나타났으나, 수동 검토 결과 해당 작업들이 즉시 병합될 수 있는 상태는 아니었다. 이는 자동 채점이 AI의 실제 세계 성능을 과대평가할 수 있음을 시사하며, 연구팀이 관찰한 개발 생산성 지연 효과와 연관 지어 해석된다. 에이전트가 구현한 코드는 테스트 통과에는 성공했으나, 코드 품질, 문서화, 린팅 문제 등으로 인해 병합 전 추가 수정이 필요하다. 이러한 결과는 AI의 시간 지평과 실제 작업 수행 능력 간의 차이를 이해하는 데 도움이 된다.