AI 안전 다이제스트

2025-07-10 · 5건

🇪🇺 EU AI Office, GPAI 안전 집행 지원을 위한 900만 유로 규모 기술지원 입찰(2025.7.10)

공공 · 유럽연합 집행위원회 디지털 전략(EC Digital Strategy) · ⚖️🛡️🔬🤖

유럽연합(EU) AI Office가 AI Act 집행을 위한 기술 지원을 조달하는 입찰을 공고했다. GPAI(범용 목적 AI) 모델이 EU 차원에서 공공안전·보안·기본권에 미칠 수 있는 체계적 위험을 평가·모니터링하는 역량을 강화하는 것이 목적이며, 총예산은 900만 유로다. 입찰은 6개 로트로 구성되며 1~5로트는 CBRN, 사이버 공격, 통제상실, 유해 조작, 사회기술적 위험 등 유형별 위험 모델링·평가도구 개발·기술지원·지속 모니터링을 포함하고, 6로트는 에이전틱 평가를 위한 교차 지원(동적·개방형 과제에서의 자율 행동 평가)을 제공한다.

🇪🇺 범용 AI(GPAI) 실천강령, AI Act 안전·투명성·저작권 준수 지원(2025.7.10)

K-AISI 주간동향 · 유럽연합 집행위원회 디지털 전략(Digital Strategy) 웹사이트 · ⚖️📋

유럽연합 집행위원회는 범용 목적 AI 모델(GPAI) 사업자가 AI Act의 안전·투명성·저작권 의무를 이행하는 데 도움을 주는 ‘General-Purpose AI Code of Practice’를 2025.7.10 공개했다. 이 강령은 자발적 도구이며, 서명한 사업자는 강령 준수를 통해 AI Act 준수 입증에 따른 행정 부담을 줄이고 법적 확실성과 신뢰를 높일 수 있다고 설명한다. 강령은 투명성·저작권·안전 및 보안의 3개 장으로 구성되며, 서명 절차는 Signatory Form 작성 후 EU-AIOFFICE-CODE-SIGNATURES@ec.europa.eu로 제출하는 방식이다.

🇬🇧 AISI, white box control로 sandbagging(평가 시 의도적 저성능) 탐지 연구 진행(2025.7.10)

K-AISI 주간동향 · AI Security Institute(AISI-UK) · 🚀

AI Security Institute(AISI)는 black box control(외부 출력·chain-of-thought 모니터링)과 white box control(내부 activation 관찰·수정)을 구분하고, misaligned 모델의 위해를 막기 위한 접근으로 white box를 설명했다. 특히 sandbagging 탐지를 위해 Llama-3.1-8B-Instruct와 Llama-3.3-70B-Instruct를 대상으로 실험했으며, 작은 모델·단순 과제에서는 white box 방식인 deception probes가 효과적이었고 black box 모니터는 상대적으로 어려움을 보였다고 밝혔다. 다만 모델 크기와 과제 복잡도가 커지면 white/black box 모두 탐지 성능이 떨어졌고, 과거 테스트 로그를 black box로 분석했을 때는 의도적 저성능을 드러내는 out-loud reasoning 증거는 찾지 못했다고 전했다.

🇺🇸 Early-2025 AI Slows Down Experienced Developers (2025.7.10)

공공 · METR

본 연구는 2025년 초의 AI 도구가 경험이 풍부한 오픈소스 개발자의 생산성에 미치는 영향을 랜덤화 대조 시험을 통해 분석했습니다. 결과적으로, 개발자들이 AI 도구를 사용할 때 작업 완료 시간이 평균 19% 증가하여 예상과 달리 생산성이 느려진 것으로 나타났습니다. 이러한 결과는 AI 기술이 발전함에 따라 계속 연구될 계획입니다. 연구는 AI가 AI 연구 개발 자체에 미치는 영향을 이해하는 데 중요한 통찰력을 제공합니다.

말레이시아 부부, AI 생성 영상 보고 실존하지 않는 관광지 방문 (2025.7.10)

DB · AIID · 🚨

말레이시아의 한 노인 부부가 AI가 생성한 영상 속에 등장하는 실존하지 않는 케이블카 관광지를 방문하기 위해 쿠알라룸푸르에서 3시간을 운전하여 페락 주까지 찾아갔다. 호텔 직원이 부부에게 해당 관광지가 실제로 존재하지 않는다는 것을 알렸지만, 부부는 온라인에서 본 영상을 믿고 방문을 강행했다. 결국 부부는 가짜 관광지에 도착했을 때 실망감을 느꼈다. 이 사건은 AI 생성 콘텐츠의 오해를 불러일으키는 잠재력을 보여준다.