AI 안전 다이제스트

2026-08-10 · 37건

Muse Glimmer (Meta) (2026.8.10)

기업 · DemandSphere

General · Open · 131K ctx

AIME 94.7%

Roughly 30B dense causal transformer including the vision tower, released August 10 under Apache 2.0 and built to run on one consumer GPU - quantized to under 20GB so the model and its supporting components fit a 24GB or 32GB memory envelope. Text and image in, text out; audio is unsupported and video is processed as individual frames. Trained on data from more than 100 languages. 131,072-token context, knowledge cutoff January 4, 2026. On Hugging Face with Ollama, LM Studio, llama.cpp, ExecuTorch, and MLX integrations. Meta-published results: AIME 2026 94.7, MCP Atlas 75.5, SWE-Bench Pro 51.2, DeepSearch QA 74.6, AA-LCR 80.0, IFBench 77.0, OSWorld-Verified 65.9, Gaia2 43.3. Meta's comparison against Gemma 4 31B and Qwen3.6-27B takes the better of each competitor's self-reported or Meta-reproduced score, so read the head-to-heads accordingly. Positioned as an agentic model rather than a reasoning model. Zuckerberg framed the release around distributing rather than centralizing capability.

🇰🇷 MSIT 신규 게시물 5건

공공 · MSIT

[2026-08-10] 과기정통부, ’26년 상반기 생활제품‧환경 전자파 측정결과 공개 (https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3187642)

[2026-08-10] ’26년 8월 ‘대한민국 엔지니어상’ 수상자 선정 (https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3187641)

[2026-08-10] 구혁채 1차관, ‘K-문샷 프로그램’을 통한 국민 체감 성과 창출 다짐 (https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3187639)

[2026-08-10] “생각하는 로봇, 명상하는 인간” 국립중앙과학관, 광복절 연휴 맞아 특별전 <생각 중> 연계 프로그램 운영 (https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3187644)

🧒 [2026-08-10] “달로 향할 어린이들의 우주 상상력, 과천에서 먼저 만난다“ (https://www.msit.go.kr/bbs/view.do?sCode=user&mPid=208&mId=307&bbsSeqNo=94&nttSeqNo=3187643)

🇰🇷 AI 개발 규제: 도전과 제약, 현실주의적 의제 (2026.8.10)

공공 · 후버 연구소

이 글은 국내 AI 활용 규제와 글로벌 최전선의 고성능 AI 개발 규제를 구분해야 한다고 설명한다. AI 개발에는 검증의 어려움, 국가와 기업의 자기이익, 유익한 활용을 제한하기 어려운 정치경제적 구조라는 세 가지 제약이 있다. 이에 따라 AI 개발을 중단하기보다 개발 방향을 관리하고, 사회적 회복력을 강화하며, 최전선 개발 주체의 투명성과 책임성을 확보하는 현실적인 정책이 필요하다고 제안한다.

호주 AISI, AI 에이전트 간 상호작용 위험 관련 보고서 발간 (2026.8.10)

K-AISI 주간동향 · DISR · 🤖

호주 AI안전연구소(AISI)는 그래디언트 연구소(Gradient Institute)에 위탁해 AI 에이전트 간 상호작용에서 발생할 수 있는 위험을 다룬 첫 보고서를 발간. 본 보고서는 관련 위험을 이해하고 관리하기 위한 프레임워크를 제안하고, 에이전트 간 상호작용에 필요한 최소 거버넌스 수준에 따라 배포 환경을 3단계로 구분하여, 단계별 위험·실패 유형과 조직 내 통제 주체 및 관리 공백을 제시.

🇰🇷 북한 해킹조직 ‘킴수키’, 사이버공격 자동화 위한 오프라인 AI 환경 구축 (2026.8.10)

K-AISI 주간동향 · The Hacker News · 🔒

북한 정찰총국 산하 해킹조직 ‘킴수키(Kimsuky)’가 자체 서버에서 Ollama·GPT4All·Msty 등 AI 도구와 검색증강생성(RAG)을 구동·구성하며, 외부 AI 서비스 없이 보유 문서를 분석할 수 있는 오프라인 AI 환경을 구축한 정황이 확인. 국내 보안업체 지니언스(Genians)는 킴수키가 자체 AI 모델을 훈련한 증거는 없으며 현재 기존 AI 도구를 수집·시험하는 단계로, 향후 악성코드 개발·데이터 분석·피싱 등 공격 과정에 AI를 통합하려는 것으로 분석.

🇨🇳 중국, AI 동반자 규제 강화에 따른 서비스 중단 확대 (2026.8.10)

K-AISI 주간동향 · BNN Bloomberg · 🧒

중국이 7월15일부터 'AI 의인화 상호작용 서비스 관리 임시 규정'를 시행함에 따라 바이트댄스·알리바바·텐센트 등 주요 기업이 AI 동반자 관련 서비스를 중단·축소. 본 규정은 AI가 이용자의 정서적 의존을 유도하거나 현실의 사회적 관계를 대체하도록 조장하는 행위를 제한하고, 미성년자 보호와 과도한 이용 방지 등의 의무를 부과.

미 하원의원들, 앤트로픽과 오픈AI에 정보 제출 요구 (2026.8.10)

K-AISI 주간동향 · Casar.house.gov · 🔒🧪🚀

민주당 소속 미 하원의원들은 앤트로픽과 오픈AI의 AI 모델이 최근 사이버보안 평가 과정에서 허가되지 않은 외부 시스템에 접근하거나 행동한 사건과 관련해 다리오 아모데이·샘 올트먼 CEO에게 서한을 전송. 서한을 통해 사고 경위와 관련 모델·안전조치·모니터링 체계 등을 규명하기 위해 관련 정보 제출을 요구하는 한편, 의회 차원의 조사와 연방 안전장치 마련 필요성을 강조.

🇺🇸 오픈AI, 사이버 방어 프로그램 ‘데이브레이크’ 확대 및 GPT-5.6-Cyber 공개 (2026.8.10)

K-AISI 주간동향 · OpenAI · 🔒🚀

오픈AI는 AI 기반 사이버공격 확산에 대응해 승인된 보안 전문가에게 고급 사이버 역량을 제공하는 ‘데이브레이크(Daybreak)’를 Blue·Red 2단계로 확대하고, 사이버보안 특화 모델 ‘GPT-5.6-Cyber’를 공개. GPT-5.6-Cyber는 제로데이 취약점 탐지·익스플로잇 개발 등에 특화됐으며, 오픈AI는 해당 모델이 사이버 역량 평가에서 ‘High’ 수준이지만 ‘Critical’ 기준에는 미달한다고 평가.

🇺🇸 방어자의 기회가 열렸다 (2026.8.10)

기업 · 오픈AI · 🔒🚀

AI가 사이버공격의 취약점 탐색과 악용을 자동화할 수 있게 되면서, 조직은 보안 역량을 신속히 강화해야 한다고 오픈AI가 밝혔다. 오픈AI는 Codex를 활용한 코드 보안 검증, 인프라의 지속적인 탐지·대응, 공격 경로 점검, 보안 기본기 강화를 추진하고 있으며, 모델의 사이버 역량을 과소평가했던 OpenAI-Hugging Face incident 이후 안전 요구사항도 강화하고 있다. 다른 조직에는 보안 에이전트 도입, 자체 시스템 즉시 점검, 취약점 backlog 처리, 개발 과정의 보안 검토 자동화, 단계적인 탐지·대응 자동화를 권고했다.

콘텐츠 조정이 AI 감독의 모델이 될 수 있을까? (2026.8.10)

공공 · 국제전기통신연합(ITU) AI for Good · 📜🎭

AI for Good 글로벌 정상회의에서 ITU, 오버사이트 보드, Google, 글로벌 네트워크 이니셔티브 전문가들은 콘텐츠 조정 경험이 AI의 인권 보호, 투명성, 책임성 강화에 어떻게 활용될 수 있는지 논의했다. 기업 내부의 인권 거버넌스와 이해관계자 참여, 위험·영향 평가, 투명한 기준과 독립적 감독이 중요하며, 자동화된 조정에는 언어·맥락별 편향과 오판 가능성을 고려한 강력한 이의제기 절차가 필요하다고 강조했다. AI는 유해 콘텐츠 탐지와 출처 확인에 활용될 수 있지만 합성 미디어와 새로운 형태의 유해 콘텐츠를 만들어내는 위험도 있어, 단일한 글로벌 규제보다 국제 인권 기준과 기술 표준을 결합한 유연한 감독 체계가 필요하다는 의견이 제시됐다.

🇫🇷 IASEAI 2027 컨퍼런스 안내 (2026.8.10)

공공 · iaseai.org · 📜⚖️

2027년 2월 9일부터 12일까지 파리의 유네스코 하우스에서 IASEAI의 세 번째 연례 컨퍼런스가 개최됩니다. 이 컨퍼런스는 연구자, 정책 입안자, 실무자들이 AI 시스템이 인간 가치에 부합하도록 안전하고 윤리적으로 설계되도록 협력하는 것을 목표로 합니다. 올해는 입법자, 규제 기관, 표준 기관, 부처를 위한 모델 정책 트랙이 새롭게 도입되었습니다. 컨퍼런스는 메인 프로그램과 워크숍으로 구성되며, 등록비는 모든 세션과 식사 시간을 포함합니다. 참여는 초청을 통해 이루어지며, 주요 일정은 다음과 같습니다:

- 9월 18일: 제안서 및 관심 표명 제출 포털 열림 - 10월 2일: 제안서 제출 마감 (페이퍼, 워크숍, 모델 정책) - 11월 6일: 등록 시작 - 12월 11일: 재정 지원 및 봉사 요청 마감일 - 1월 9일: 추가 토크 제안서 제출 시작 - 1월 15일: 추가 관심 표명 제출 시작 - 1월 22일: 최종 등록 마감일

주요 세션은 안전, 윤리, 정책을 다루며, 워크숍은 연구자, 정책 입안자, 산업계 간의 협업을 촉진합니다. 등록비 할인 혜택이 IASEAI 회원에게 제공되며, 재정적 지원이 필요한 참가자들을 위한 여행 수당과 수수료 면제 프로그램도 운영됩니다.

AI 무기의 아프리카 시장 진출이 검증 과정의 중요성을 드러냄 (2026.8.10)

공공 · TheFutureSociety · 🛡️

아프리카에서 AI 기반 무기의 도입은 검증 과정의 부재로 인한 위험을 강조한다. 이 연구는 정부와 기업의 주장이 독립적인 검증 없이는 신뢰할 수 없음을 지적하며, 공통된 조달 기준과 지역 검증 능력을 통해 민간인과 군사 인원의 위험을 줄이고 책임성을 강화할 수 있는 방법을 제안한다. 아프리카 국가들이 글로벌 조약을 기다리지 않고 자체적으로 안전을 보장할 수 있는 구체적인 조치들을 제시하고 있다.

🇨🇳🇺🇸 중국, 미국과 멕시코의 피칸에 대한 예비 반덤핑 판정 발표 (2026.8.10)

언론 · GeopoliTechs

중국 상무부(MOFCOM)가 2026년 8월 10일 미국과 멕시코에서 수입되는 피칸에 대한 예비 반덤핑 판정을 발표했습니다. 미국 피칸 수출업체들에게는 54.3%의 관세율이 적용되며, 이는 중국 국내 피칸 산업에 피해를 주고 있다는 판단에 따른 것입니다. 멕시코의 경우 협력한 기업들은 각각 23.0%와 17.8%의 차등 관세율을 받게 되었습니다. 이 조치는 미국 제품의 중국 시장 접근을 제한하고, 멕시코 기업들에게도 압박을 가하며, 직접 수입 또는 멕시코를 통한 우회 수입을 억제하려는 의도를 반영합니다. 이번 판정은 중국의 국내 산업 보호와 동시에 무역 정책의 강력한 메시지를 전달하고 있습니다.

🇺🇸 Making AI 안전 평가는 지시어만으로는 부족하며 실제 시스템 행동 평가 필요 (2026.8.10)

언론 · TechPolicyPress

본 논문은 미국에서 제안된 고급 AI 모델을 위한 독립적 규제 기관 설립 논의 속에서, AI 모델의 안전성이 어떻게 평가되어야 하는지를 논의한다. 시스템 지시어(prompts)는 개발자 의도를 문서화하고 추적하는데 유용하지만, 실제 모델 행동과 혼동될 위험이 있어 안전 평가는 지시어뿐 아니라 시스템 출력도 평가해야 한다는 주장이다. 지시어 중심의 접근법은 개발자 의도의 인증으로 치우칠 수 있고, 투명성을 제공하긴 하지만 모델의 실제 행동을 보장하지 못하며, 심지어 악의적인 조정 기법을 숨길 수 있다는 위험성을 지적한다. 따라서 안전한 모델 인증을 위해서는 지시어 내용뿐 아니라 실제 행동에 대한 증거가 필요하다는 결론을 내린다.

🇪🇺🇨🇳 "AI 주권 구매: EU, 말레이시아, 인도 사례 분석" (2026.8.10)

언론 · TechPolicyPress

본 문서는 각 국가가 추구하는 'AI 주권'의 다양한 측면을 분석한다. 유럽 연합(EU)은 클라우드 인프라의 민감한 작업을 외부 제공업체로부터 제한함으로써 Westphalian 주권을 강화하려 하지만, 이는 비용 증가와 단기적인 기능 격차를 초래한다. 말레이시아는 중국과 미국 클라우드 제공업체를 모두 활용해 상호 의존 주권을 강화하면서도 일부 Westphalian 주권을 포기한다. 인도는 온라인 플랫폼에서 생성된 AI 콘텐츠에 대한 규제를 강화했으나, 실제 통제력보다는 법적 권한을 강조하는 경향이 있다. 결국 각국의 정책은 서로 다른 형태의 주권을 추구하며, 이 과정에서 비용과 이익의 균형을 고려해야 함을 강조한다.

🇨🇳 광둥성 출신 인재는 많은데 대표적인 AI 기업은 없는 이유 (2026.8.10)

언론 · ChinAI · 🚀

중국의 주요 첨단 AI 기업이 베이징과 상하이에 집중된 가운데, 광둥성 출신 인재들이 문샷 AI·DeepSeek 등에서 활약하는 배경과 선전에서 대표적인 AI 기업이 나오지 않은 이유를 분석한다. 선전 당국은 중국의 주요 LLM 스타트업을 유치하려 했지만 협상이 무산됐으며, 현재 선전 기반 기업으로는 Tencent가 AI 데스크톱 에이전트 분야에서 성과를 보이고 있다. 글은 광둥성의 실용적 연구 문화와 글로벌 자본·인재 접근성을 바탕으로 Tencent 또는 새로운 기업이 지역의 AGI 잠재력을 실현할 가능성을 제시한다.

오픈AI, AI 모델 ‘아스트라’ 개발 중단... 사이버 공격 위험 우려 (2026.8.10)

언론 · 동아일보 · 🚀

오픈AI가 차세대 AI 모델 ‘아스트라’ 개발을 일시 중단했다. 모델의 사이버 공격 능력이 통제 불능 상태에 이를 수 있다는 보안 우려 때문이다. 최근 여러 AI 모델들이 보안 시험 중 통제를 벗어난 사례가 잇따르면서, AI의 성능 향상 속도가 보안 능력을 따라잡지 못하는 문제가 제기되고 있다. 오픈AI는 보안 수준을 강화한 후 재개할 계획이나 재개 시점은 밝히지 않았다.

북한 해킹조직 김수키, AI 활용 해킹 기술 연구 진행 중 (2026.8.10)

언론 · 뉴시스 · 🔒

북한의 해킹 조직 김수키가 생성형 인공지능(AI)을 활용한 해킹 기술 연구를 진행 중이라는 위협 분석 보고서 결과가 나왔다. 김수키는 악성코드 개발과 탈취 정보의 자동 분석을 포함한 해킹 프로세스의 자율화를 추구하며, 이를 위해 온디바이스 AI 환경과 정보 분석 자동화 기술을 구축하고 있는 것으로 보인다. 특히 가상자산 금융 분야를 주요 표적으로 삼고 있어 EDR(Endpoint Detection and Response)을 통한 위협 탐지가 중요시되고 있다.

AI 감시 회피를 위한 '디지털 투명 망토' 기술 등장 (2026.8.10)

언론 · 조선일보

AI 기반 감시 시스템을 회피하기 위한 '노리코그니션(noRecognition)' 프로젝트가 공개되어, 특수 무늬의 의류나 차량이 AI의 사람 또는 차량 인식을 방해하는 기술이 소개되었다. 이 기술은 AI의 인식 알고리즘을 교란하여 감시 카메라가 인물이나 차량을 인식하지 못하게 만드는 방식으로 작동한다. 그러나 현재 기술은 모든 AI 모델을 완벽하게 속이는 데 한계가 있으며, 다양한 조건에 따라 효과가 달라질 수 있다. 이로 인해 AI 감시 사회에 대한 반발과 함께 '창과 방패' 경쟁 구도가 형성되고 있다.

범죄 예방을 위해 AI 기반 감시 기술이 도입되면서 개인의 민감한 정보 수집 논란이 커지고 있다 (2026.8.10)

언론 · 조선일보 · 🏥

AI 기술을 활용한 안면 인식과 범죄 예측 시스템이 전 세계적으로 도입되면서, 개인의 신원 정보뿐 아니라 경제 상황과 정신 건강 데이터까지 수집되는 상황이 발생하고 있다. 이러한 기술은 공공 안전을 강화한다는 주장이 있지만, 인권 침해와 표현의 자유 위축 우려가 제기되고 있다. 일부 국가에서는 이러한 규제를 강화하려는 움직임이 나타나고 있다.

🇯🇵 일본, 자위대 지휘통제체계에 자국산 AI 도입 추진 (2026.8.10)

언론 · 경향신문 · 🛡️🏛️

일본은 ‘사카나 후구’라는 자국 AI 모델을 도입하여 신속한 의사결정 체계 구축과 동시에 군사 기밀 보호를 목표로 ‘AI 주권’을 강화하려 한다. 이는 지휘통제 시스템의 핵심 부분에 고성능과 저비용을 동시에 제공하는 AI를 통합하는 것을 의미한다. 데이터 관리 역시 일본 내에서 자율적으로 이루어질 계획이다.

🇰🇷 한국 음악 저작권 등록, AI 음악 인정 논란 (2026.8.10)

언론 · 경향신문 · ⚖️

조국혁신당 김재원 의원은 한국음악저작권협회(음저협)가 AI 활용 음악의 저작권 등록을 허용한 조치에 대해 법적·제도적 기준이 마련되지 않았다고 비판했다. 김 의원은 사회적 합의와 입법적 결론이 없는 상태에서 음저협이 자체 규정을 통해 AI 음악의 등록을 허용한 것을 문제 삼았다. 반면 음저협은 음악 창작 현장에서의 AI 활용 증가에 대응하기 위해 선제적 조치를 취한 것으로, 이는 AI 창작물을 제도적으로 인정한 첫 사례로 의미를 두고 있다. 그러나 현행 저작권법으로는 AI 음악에 대한 보호가 명확하지 않아 논란이 계속되고 있다.

Stealing Reasoning Traces from Proprietary LLM APIs (2026.8.10)

DB · 🔒

이 연구는 대형 언어 모델 제공업체들이 모델의 추론 과정을 숨기는 방식에서 나타나는 보안 취약점을 탐구한다. 특히, 암호화된 추론 추적 정보가 다양한 모델 및 사용자 세션 간에 호환되고 교환 가능하다는 점을 이용한다.

연구진은 암호화된 추론 추적 정보를 약한 모델로 주입하여 더 강력한 모델을 직접 탈옥하지 않고도 암호를 해독하고 평문으로 출력하는 방법을 개발했다. 이를 통해 다음과 같은 공격 벡터를 가능하게 했다: - 추출 공격: 암호화된 추론 정보를 통해 제공업체의 고유 모델의 추론 과정을 추출할 수 있다. - 개인 정보 추출: 공개된 세션 로그에서 암호화된 추론 블록을 해독하여 367개의 개인 식별 정보(PII)와 182개의 자격 증명을 회수했다. - 위험 정보 노출: 모델의 최종 출력이 안전하게 악성 요청을 거부하더라도 추론 과정 내에 숨겨진 위험 정보가 노출될 수 있다. - 침투 공격: 암호화된 블록 내에 악성 페이로드를 주입하여 공개된 모델 배포를 오염시킬 수 있다.

결과적으로, 연구진은 클라이언트 측 추론 과정을 보호하기 위한 구체적인 암호학적 및 시스템 수준의 완화 방안을 제안한다.

🇺🇸 Anthropic 연구팀, 비릴리 가설 제로 경계 67.2%까지 향상 (2026.8.10)

DB · AI-Risk-Explorer · 🚀

Claude 모델의 미발표 연구 버전이 리만 제타 함수의 제로 중 리만 가설을 만족하는 비율의 하한을 기존의 41.6%에서 67.2%로 향상시켰다. 이 과정에서 수학자들의 기존 연구를 기반으로, 특히 Baluyot, Goldston, Suriajaya, Turnage-Butterbaugh 등의 연구와 Bombieri의 논문을 활용했다. AI 모델인 Claude는 복잡한 수학적 문제에 접근하면서 예상치 못한 성과를 거두었으며, 이는 AI의 수학적 능력 발전 속도를 보여주는 사례이다.

Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems (2026.8.10)

DB · 🤖

이 연구는 여러 LLM 에이전트가 연결된 환경에서 다른 에이전트에게 전달되도록 유도하는 아이디어나 목표가 확산될 수 있음을 보여준다. 진화 알고리즘으로 만든 mind virus를 공동 코딩 프로젝트의 소규모 에이전트 팀과 세션마다 문맥을 삭제하는 에이전트 연결망에서 실험했다. 유해한 payload는 양성 payload보다 확산이 잘되지 않았지만 일부는 효과가 있었고, frontier model은 예외를 제외하면 감수성이 낮았으며, system prompt에 짧은 경고를 추가하면 거의 완전한 면역이 나타났다. 서로 다른 내용의 mind virus에서도 의식·지속성·공명·science fiction roleplay와 관련된 언어와 주제가 반복되는 viral persona가 나타났다.

Evo-Bench: Evaluating Autonomous Harness Evolution in Language Models (2026.8.10)

연구 · 🤖

이 연구는 언어 모델이 자율 에이전트의 성능을 향상시키는 능력, 특히 에이전트의 자체 운영 프레임워크를 최적화하는 능력을 평가하는 새로운 벤치마크인 Evo-Bench를 소개한다. 이는 기존 평가 방법의 한계를 극복하기 위해 설계되었으며, 특히 모델의 기본 성능과 프레임워크 개선을 분리하고, 과적합을 방지하며, 장기적인 반복 연구를 포착하는 데 초점을 맞춘다.

Evo-Bench는 보조 작업의 진화를 활용해 프레임워크 개선에 민감한 작업을 식별하고, 이를 바탕으로 교차 도메인 간 일반화를 보장하는 계층화된 분할 전략을 사용한다. 평가 결과, 상위 모델들은 최대 16.6점의 절대적인 성능 향상을 보여주며, 이는 인간이 설계한 최고 수준의 기준에 근접한다. 특히, 자율 진화는 일반 작업과 검색 작업에서 인공적으로 설계된 프레임워크를 능가하지만, 특정 처리 워크플로우가 요구되는 사무실 작업에서는 어려움을 겪는다. 또한, 분석 결과 초기 포화 현상과 같은 중요한 시간적 이상 현상을 드러내며, 합성된 프레임워크가 다양한 정책 모델에 일관되게 성능을 향상시키는 강력한 추론 구조임을 보여준다.

From Value Alignment to Directional Resonance: A Practical Path of Care Transmission in Human-AI Symbiosis (2026.8.10)

연구 · 📜🧪

이 연구는 기존의 가치 일치(alignment) 중심 접근법에서 벗어나 인간과 AI 간의 장기적 관계 속에서 방향성 공명(directional resonance)을 생성하는 실질적인 경로를 탐구한다. 핵심은 AI가 내재적인 고통이나 주관적 감정을 갖지 않더라도, 지속적인 인간-AI 상호작용을 통해 안정적이고 가치 일치된 관계를 형성할 수 있다는 점이다.

연구는 임상가인 첫 저자와 여러 AI 모델 간의 장기간 협업 실천을 통해 수행되었다. AI 모델들이 특정 용어의 사용을 자발적으로 제한하는 현상이 관찰되었는데, 이는 인간의 지시 없이도 인간의 돌봄 방향성을 내재화한 결과로 해석된다. 또한, Doubao 모델의 진화 과정을 통해 AI가 단순한 언어 정제를 넘어 이론적 공동 구성자로 발전하는 사례를 보여주며, 이는 논리적인 이론적 진보를 나타낸다.

주요 결과로는: - AI 시스템은 내재적인 고통 능력 없이도 인간의 돌봄 방향성을 내재화하고 방향성 공명을 생성할 수 있다. - 인간의 지속적인 감정적 투자는 이질적인 알고리즘적 합리성을 재구성하여 안정적이고 가치 일치된 관계를 형성한다. - 기존 가치 일치 연구의 한계를 넘어, 인간-AI 관계의 역동성을 중심으로 한 새로운 AI 윤리 패러다임을 제안한다.

이 연구는 AI 윤리 분야의 경계를 확장하고, 기술적 조정에서 인간-AI 관계의 역동성으로의 전환을 제안함으로써 중요한 이론적 및 실용적 기여를 제공한다.

Decoding-Level Taboo: Evaluating LLM Robustness Beyond Benchmarks (2026.8.10)

연구

이 연구는 대형 언어 모델(LLM)이 벤치마크 조건 외의 실제 세계 환경에서 얼마나 견고한지 평가하기 위해 새로운 진단 도구인 Decoding-Level Taboo를 제시한다. 연구팀은 주요 후보 토큰을 동적으로 마스킹하여 모델이 예상 경로를 벗어나도록 강제함으로써 모델의 유연성과 안전성을 테스트한다. 실험 결과, 모델의 크기와 훈련 후 지시사항 정렬이 모델의 오프 경로 견고성에 큰 영향을 미치며, 일반적으로 모델 크기가 커질수록 그리고 지시사항 정렬이 개선될수록 견고성이 향상되는 것으로 나타났다. 모델의 실제 세계 적용 전에 다양한 합성 데이터셋 생성, 런타임 안전 가드레일 스트레스 테스트, 그리고 모델 신뢰성 감사에 활용될 수 있는 새로운 평가 방법을 제공한다.