AI가 인간 언어로 ‘생각’을 할 때, 해당 chains of thought(CoT)를 감시해 악의적 의도를 파악할 수 있는 기회가 있다고 설명한다. CoT 모니터링은 다른 감독 방법과 마찬가지로 완벽하지 않아 일부 위법 행위가 탐지되지 않을 수 있지만, 잠재력이 있어 추가 연구와 기존 안전 방법과의 병행 투자를 권고한다. 또한 CoT monitorability가 ‘fragile(취약)’할 수 있으므로, 프론티어 모델 개발자들이 개발 과정의 결정이 CoT monitorability에 미치는 영향을 고려해야 한다.
본문은 AI TEVV(테스트·평가·검증) 관련 표준의 “Proposed Zero Draft” 문서 개요를 담은 PDF 파일로 보이며, 페이지 내에는 PDF 구조 정보(xref 등)만 추출되어 핵심 내용 문장이 확인되지 않습니다. 따라서 표준의 구체적 요구사항, 범위, 절차 등은 현재 제공된 텍스트만으로 요약할 수 없습니다.
S&P 500 상장사 500곳의 Form 10-K를 분석한 결과, 지난 1년간 3/4 기업이 AI 관련 위험 공시를 확대·상세화한 것으로 나타났다. 산업 전반에서 절반 이상이 AI 위험을 늘렸고, IT 분야 증가폭이 가장 컸으며 금융·커뮤니케이션서비스가 뒤를 이었다. 특히 39%(193개사)는 범죄자 등이 AI를 이용해 디지털 사칭, 허위정보 확산, 악성코드 생성 등에 악용할 위험을 언급했고, 딥페이크(조작 이미지·영상·음성) 언급도 크게 늘었다. 한편 AI 투자에 대해 11%(57개사)는 지출을 회수하지 못하거나 기대효과를 얻지 못할 수 있다고 명시했으며, 데이터 프라이버시·지식재산권 위험은 19%만 공시를 확대한 것으로 조사됐다.
AI 연구자들이 OpenAI·Google DeepMind·Anthropic 등과 함께 ‘추론 모델의 chain-of-thought(CoT)를 모니터링’하는 안전 연구를 더 깊게 조사하자고 촉구했다. 이들은 o3·R1 같은 추론 모델의 CoT가 에이전트 의사결정 과정을 들여다볼 수 있는 수단이 될 수 있지만, 현재의 가시성이 유지되지 않거나 신뢰성이 약해질 수 있어 투명성과 신뢰도를 떨어뜨리는 개입은 피해야 한다고 밝혔다. 또한 CoT가 얼마나 ‘monitorable(모니터 가능)’한지 결정하는 요인을 연구하고, 장기적으로 이를 안전 조치로 구현하는 방안도 검토하자고 제안했다.
영국 정부의 테러 입법 독립 검토관 Jonathan Hall이 연례 보고서에서 생성형 AI가 테러 선전과 공격 준비를 “가속”할 수 있다고 경고했다. 그는 generative AI가 텍스트·이미지·오디오·비디오 등 새 콘텐츠를 만들어 테러에 악용될 수 있으며, 기업들이 모델 내부를 충분히 설명하지 않는 상황과 함께 이미 “jailbreaking” 산업이 존재한다고 지적했다. 또한 챗봇이 고립된 개인의 급진화를 돕는 “closed loop”를 만들거나, 잠재적 모집을 선별해 인간 단계로 넘기는 데 활용될 수 있다고 우려했다.
Anthropic은 미국이 AI 경쟁에서 선두를 유지하기 위해 에너지 인프라에 대한 투자가 필수적이라고 강조하며, $2 백만 달러를 Carnegie Mellon University에 기부한다고 발표했습니다. 기부는 AI 기반 에너지 솔루션 개발과 사이버 보안 인력 양성을 위한 두 가지 핵심 영역에 분배됩니다. 구체적으로, $1 백만 달러는 Scott Institute for Energy Innovation과 협력하여 그리드 관리 자동화 및 최적화를 위한 에너지 연구를 지원하고, 나머지 $1 백만 달러는 사이버 보안 교육 프로그램인 picoCTF를 지원합니다. 이러한 투자는 미국의 에너지 독립성 강화와 AI의 긍정적인 영향 확대를 위한 첫걸음이며, 정부와 산업계의 협력을 통해 장기적인 AI 리더십을 구축할 계획입니다.
앤써픽은 사이버 보안과 AI 분야에서 중요한 시기에 있다고 보고 있으며, 클레어 모델 4(Opus와 Sonnet 버전)가 사이버 공격 능력에서 인간 수준에 근접하고 있음을 확인하기 위해 패턴 랩스와 협력하여 심도 있는 평가를 진행했습니다. 평가 결과, 클레어 모델 4는 유연한 사고와 실패한 접근법에 고착되지 않고 적응하는 능력에서 크게 발전했으며, 복잡한 취약점 식별과 다단계 공격 수행에서도 향상된 성과를 보였습니다. 하지만 장기적인 계획 유지와 예상치 못한 장애물에 대처하는 데는 여전히 한계가 있음을 확인했습니다. 자세한 평가 결과는 패턴 랩스의 보고서에서 확인 가능합니다.
Anthropic은 금융 분석을 혁신하는 종합 솔루션인 'Claude for Financial Services'를 출시했습니다. 이 솔루션은 시장 분석, 연구 수행, 투자 결정 과정을 개선하기 위해 금융 전문가들이 사용할 수 있는 통합 플랫폼을 제공합니다. 주요 기능으로는:
- Claude 모델: 금융 작업에서 뛰어난 성능을 보이는 Claude 모델로, 다양한 금융 업무에서 연구 에이전트 역할을 수행합니다.
- Claude Code 및 엔터프라이즈 기능: 고급 트레이딩 시스템 개발, 자동화된 준수 관리, 복잡한 분석 수행 등을 지원합니다.
- 사전 구축된 MCP 커넥터: Box, Daloopa, Databricks, FactSet, Morningstar, Palantir, PitchBook, S&P Global, Snowflake 등 주요 데이터 제공업체와의 통합으로 포괄적인 금융 데이터 접근이 가능합니다.
- 전문가 구현 지원: 빠른 가치 실현을 위한 맞춤형 온보딩, 교육, 최적의 실무 지침 제공.
금융 기관들은 데이터 보호에 대한 최고 수준의 기준을 요구하며, 이 솔루션은 사용자 데이터를 훈련 모델에 사용하지 않아 지적 재산과 고객 정보의 기밀성을 유지합니다. 여러 금융 기관들은 이 솔루션을 통해 분석 속도와 정확성을 향상시키고 있습니다.
시작 방법으로는 즉시 배포, API를 통한 맞춤 개발, 또는 Claude Code를 활용한 코드 현대화 등 다양한 옵션이 제공됩니다. AWS Marketplace에서 이용 가능하며, Google Cloud Marketplace에서도 곧 이용 가능할 예정입니다.
Mistral AI가 24B 규모의 Voxtral과 3B 규모의 Voxtral Mini를 Apache 2.0 라이선스로 공개하고 API도 제공한다. 두 모델은 최대 30분 음성 전사와 40분 음성 이해, 다국어 처리, 음성 기반 질의응답·요약·함수 호출을 지원하며, API 가격은 분당 0.001달러부터 시작한다. 벤치마크에서 Voxtral은 Whisper large-v3를 전반적으로 앞섰고, 일부 전사·음성 번역 과제에서 최고 수준의 성능을 보였으며, 향후 화자 분할·감정 인식·단어 단위 타임스탬프 등을 추가할 예정이다.