🇺🇸 Grok 4.3 (xAI) (2026.5.6)
Reasoning · Closed · 2000K ctx · $1.25/M · $2.5/M
벤치마크 미공개
1M context. Three reasoning intensity levels. $1.25/$2.50 per 1M tokens. GA May 6 (beta Apr 17).
Reasoning · Closed · 2000K ctx · $1.25/M · $2.5/M
벤치마크 미공개
1M context. Three reasoning intensity levels. $1.25/$2.50 per 1M tokens. GA May 6 (beta Apr 17).
정부와 마이크로소프트가 고위험 AI 역량을 평가하고 이를 다루기 위한 안전장치(safeguards)의 효과를 발전시키는 데 초점을 둔 신규 파트너십을 발표했다. 또한 대화형 AI가 민감하지 않은 맥락에서 사용자와 어떻게 상호작용하는지 등 사회적 회복탄력성 관련 연구도 포함된다. AI 성능이 고도화될수록 정부와 기업 간 지속적인 양방향 협력이 공공안전과 국가안보의 대규모 위험을 이해하는 데 필요하다고 밝혔다.
오늘부터 시행되는 사용 한도 조정(Claude Code 요금제 한도 상향·피크 시간 제한 완화, Claude Opus API 레이트리밋 대폭 상향)
앤트로픽은 SpaceX와 파트너십을 체결해 Colossus 1 데이터센터의 컴퓨트 용량을 확보함으로써 Claude Code와 Claude API의 사용 한도를 늘렸다고 밝혔다. 이번 조치로 Claude Code의 5시간 레이트리밋을 Pro/Max/Team 및 좌석 기반 Enterprise에서 2배로 올리고, Pro와 Max 계정의 피크 시간 제한 완화도 적용한다. 또한 Claude Opus 모델의 API 레이트리밋을 상당 폭 상향하며, 추가로 300MW 이상(220,000대+ NVIDIA GPU)의 신규 용량을 한 달 내 확보할 수 있다고 설명했다.
출처: EU-Digital-Strategy
2026.5.5 EU-일본 디지털 파트너십 협의회 제4차 회의(브뤼셀)에서 약정 체결
EU 집행위의 디지털서비스법(DSA) 집행 담당 부서가 일본 내무통신성(MIC)과 온라인 플랫폼 규제 집행을 지원하는 협력 약정을 체결했다. 이번 약정은 EU의 DSA와 일본의 정보유통플랫폼법에 대한 감독·감시 업무를 각각 지원하며, 온라인 플랫폼의 투명성 요건과 공지·조치 메커니즘 등 공통 관심 분야를 다룬다. 기술 전문가 대화, 기술 인력 공동 교육, 모범사례 공유, 공동 연구·조사 프로젝트 등을 통해 협력을 진행한다.
캐나다 개인정보보호위원회는 OpenAI의 ChatGPT 초기 학습·운영 방식이 연방 민간부문 개인정보보호법(PIPEDA)에 부합하지 않는다고 보고, 시정이 조건부로 해결됐다고 밝혔다. 공동조사는 ChatGPT의 개인정보 수집·이용·공개 전반을 점검했으며, 과도한 개인정보 수집, 유효한 동의·투명성 부족, 개인정보 관련 사실 부정확성, 개인정보 열람·정정·삭제 접근성 문제, 개인정보에 대한 책임성 부족 등을 확인했다. OpenAI는 새 모델 학습에 사용되는 개인정보와 민감정보를 크게 제한하고, 캐나다인에게 ChatGPT 사용의 함의를 더 잘 알리기 위한 조치를 진행(또는 약속)했으며, 위 조치가 조사에서 제기된 우려를 해소할 것으로 평가됐다.
Epoch AI는 기존 추론 벤치마크가 텍스트만 제공하고, 답을 쉽게 채점하며, 전문가 인간이 단시간에 풀 수 있다는 ‘고전 레시피’가 현재는 포화에 가까워졌다고 지적했다. 대신 멀티모달(예: 시각·공간 추론), 더 긴 시간 지평(게임 연속 플레이·장기 소프트웨어 공학 등), 채점이 어려운 산출물(실환경 평가·전문가/기관의 기존 채점 관행 활용), 인간 최고 수준을 넘어서는 과제(프로그램으로 검증 가능한 오픈 문제·최적화 문제 등)로 벤치마크를 확장하는 방향을 제안했다. 또한 단순한 ‘상식 함정’ 유형의 오류를 측정하는 벤치마크도 AI의 과도한 무오류 주장에 대한 균형을 주는 역할을 할 수 있다고 언급했다.
EU는 AI 생성 미디어의 투명성을 높이기 위해 자발적인 코드의 실천 과정을 시작하여 AI 법의 구현을 지원하고 있다. 이 문서는 AI 생성 오디오와 비디오 콘텐츠의 투명성을 강화하기 위한 세 가지 주요 제안을 제시한다:
1. 기술적 표시: 콘텐츠 전반에 걸쳐 보안적으로 이동하는 간접적 공개 메커니즘을 강화하여 프라이버시를 보호하면서 혁신과 창의적 표현을 지원한다. 2. 사용자 이해: 표준화된 직접 공개 아이콘을 통해 사용자들이 투명성 신호를 이해할 수 있도록 하며, 다양한 콘텐츠 유형과 맥락에 맞춘 유연성을 유지한다. 3. 교육 및 연구: 사용자 교육과 취약 계층을 대상으로 한 연구를 통해 투명성 표시의 효과를 극대화하고, 부정적 영향을 최소화한다.
이러한 노력은 미디어 소비자들이 정보를 더 잘 이해하고 판단할 수 있도록 돕는 동시에, 기술의 발전에 따른 윤리적 문제를 해결하는 데 중점을 둔다.
유럽연합(EU)의 AI 기가팩토리(AI Gigafactory) 프로젝트는 현재까지 가장 큰 규모의 컴퓨팅 투자로, 다섯 개의 기가팩토리 건설을 목표로 하고 있다. 이 프로젝트는 AI의 경제적 및 국가 안보적 중요성이 커짐에 따라 EU의 인식을 반영한다. 하지만, 기술 발전 속도와 공급 제약으로 인해 기가팩토리가 목표한 경쟁력을 달성하기 어려울 수 있다.
이에 따라 The Future Society는 기가팩토리가 유럽의 첨단 AI 목표를 달성하기 위해 해결해야 할 네 가지 설계 원칙을 제시한다: 1. 목적에 맞는 하드웨어: 미래의 컴퓨팅 수요 증가에 대비한 확장성과 공급 안정성을 갖춘 최신 하드웨어 도입. 2. 단계적 보안 체계: 다양한 민감도에 따른 보안 수준을 갖춘 체계적인 사이버 보안 전략 구현, 특히 민감한 작업을 위한 고급 보안 수준의 기가팩토리 구축. 3. 설계 단계에서의 상호 운용성: 기가팩토리 간, 다른 AI 팩토리와의, 그리고 민간 클라우드와의 상호 운용성을 위한 기술적 기반 구축. 4. 유연한 운영 모델: 다양한 수요 변화에 대응할 수 있는 유연한 운영 모델 도입으로, 용량의 효율적 활용과 유럽 사용자의 우선 접근권 보장.
이러한 네 가지 원칙은 기가팩토리가 경쟁력 있고 주권적이며 안전한 유럽 컴퓨팅 인프라를 구축하는 데 필수적이다.
마감일/시행일: 명시되지 않음
OpenAI는 GPT-5.1부터 답변에 고블린·그렘린 같은 신화 생물이 끼어들기 시작했다고 밝혔다. 이는 ChatGPT의 ‘Nerdy’ 성격 옵션 학습 과정에서 해당 언급이 보상 신호로 작동했기 때문이라고 설명했으며, 이후 Codex 지침에 고블린·그렘린·트롤·오거 등 언급을 사용자의 질문과 “명확히 관련”될 때로 제한하는 문구를 포함했다고 전했다. ‘고블린 모드’가 밈처럼 확산되자 OpenAI는 문제를 인지하고 조정했으며, 일부 평가 사이트에서도 GPT-5.5의 관련 단어 사용 증가가 관찰됐다고 보도했다.
EU 의회와 회원국 협상단이 AI 규정 일부를 2027년 12월까지 지연하는 방안과 ‘AI 넛지(유도) 앱’ 금지 등을 포함한 합의에 실패했다. 특히 기계 및 의료기기 분야의 적용 방식이 핵심 쟁점이었으며, 독일 등 중심권은 산업용 AI를 AI법이 아닌 분야별(섹터) 법으로 처리하는 완화안을 요구한 것으로 전해졌다. 협상은 일단 중단됐고 재개 일정은 확정되지 않았으며, 고위험 AI 신규 규정은 8월부터 시행될 예정이라 법적 불확실성 우려가 커졌다는 내용이다.
Anthropic과 FIS가 은행의 금융범죄를 탐지하고 대응하는 데 활용할 AI 에이전트를 개발한다는 내용입니다. 다만 본문을 확인하지 못해 구체적인 기능, 적용 범위, 일정 및 성과 지표는 확인 필요합니다.
싱가포르 경쟁소비자위원회(CCS)는 기업이 AI 소프트웨어를 직접 개발했는지, 제3자 시스템을 사용했는지와 무관하게 ‘예견 가능한’ 반경쟁(반독점) 피해에 대해 책임을 져야 한다고 밝혔다. CCS는 기업들이 AI 가격·의사결정 도구를 도입할 때 경쟁법 준수를 ‘설계 단계부터’ 점검해야 하며, AI의 블랙박스 특성으로 인해 알고리즘이 담합을 조장하는지 감독이 어려울 수 있다고 설명했다. 한편 CCS는 싱가포르에서 알고리즘 담합의 증거가 아직 제한적이라는 예비 판단을 내렸고, AI 시장 관련 오픈소스 툴킷을 통해 기업의 자체 점검과 리스크 완화를 돕겠다고 했다.
8월 2일 고위험 AI 의무 관련 마감일이 임박해, 8월 2일 이전 합의 도출 압박이 커지고 있음
MLex에 따르면 EU 정책당국은 8월 2일 고위험 AI 의무 관련 마감이 다가오자, AI Act의 입법 개정안을 논의하기 위해 5월 중 회의를 진행할 예정이다. 이번 논의의 핵심은 의료기기·기계·차량 등 이미 분야별(섹터별) 규제를 받는 제품에 대해 AI Act가 어떻게 적용될지 개정하는 방안이다. 지난주에는 해당 적용 방식에 대한 합의가 지연되며 교착상태가 있었던 것으로 전해졌다.
Nemotron-Personas-Korea는 KOSIS·대법원·국민건강보험공단 등의 한국 공공 통계를 바탕으로 약 100만 건의 인구통계 레코드를 만들고, 이를 7가지 서술로 확장해 약 700만 개의 텍스트를 생성한 합성 페르소나 데이터셋이다. PGM은 인구 속성 간 결합 분포의 정합성을, LLM은 자연스러운 한국어 서사 생성을 담당하며, 데이터셋은 CC BY 4.0으로 공개돼 상업적 활용이 가능하다. 모델 학습·에이전트 프롬프트·사회 시뮬레이션·공정성 평가 등에 활용될 수 있지만, 통계적 가정과 LLM 편향, 소수 집단의 과소대표, 통계 변화에 따른 현실과의 불일치라는 한계도 있다.
플로리다주 여성 멜리사 심스는 전 남자친구에게 접근하지 말라는 명령을 문자메시지로 위반한 혐의로 24시간 구금됐지만, 해당 문자를 보내지 않았으며 조작된 증거라고 주장했다. 이후 통신사 기록이 심스의 주장을 뒷받침했고, 사이버보안 전문가는 AI 기술 발전으로 설득력 있는 가짜 디지털 증거를 만들기 쉬워졌다고 설명했다. 문자메시지 관련 혐의는 기소되지 않았으며, 심스는 별도의 가정폭력 사건에서도 무죄 판결을 받았다.
미국과 중국이 AI 경쟁이 통제 불능의 위기로 확산되지 않도록 위험 관리 장치(가드레일)를 논의한다는 내용입니다. 다만 제공된 정보에는 본문 원문이 없어 구체적인 합의 내용, 논의 방식(대화 채널·일정), 포함되는 범위는 확인이 필요합니다.
펜타곤의 대(對)중국 기술·기업 관련 블랙리스트 조치가 미국과 중국의 기술 협력에 혼선을 야기했다는 취지의 보도다. 다만 제공된 정보에는 기사 본문이 없어, 어떤 기업이 포함·제외되었는지와 ‘오류(미스스텝)’의 구체적 내용은 확인 필요다. CSV 정보에 따르면 펜타곤이 알리바바와 바이두의 군사 목록 추가를 되돌렸다는 내용이 있으나, 블룸버그 기사와의 직접 연계는 확인 필요다.
메르츠의 EU AI 규제 완화(축소) 추진에 대해 연정 파트너가 반대 입장을 보였다는 내용의 기사입니다. 다만 본문 정보가 제공되지 않아 반대 사유, 구체적 쟁점(어떤 규정/범위인지), 향후 협상 방향은 확인이 필요합니다.
본 연구는 디지털 전환과 SDx 확산으로 자동차가 SDV(Software-Defined Vehicle)로 전환되는 과정에서 SW·AI 인력 공급이 부족한 문제를 넘어, 전환 단계·직무·숙련·기업유형 간 구조적 미스매치로 규정하고 실증 분석했다. 분석 결과 자동차산업은 SDV 관련 R&D 비중과 인력 투입이 확산 단계에 있으나, 소프트웨어 중심 내재화 수준은 초기 단계에 머물러 핵심 SW 인력 비중이 낮게 유지되는 것으로 나타났다. 또한 SDV 전체 인력 부족률보다 SW·AI 인력 부족률이 더 높아 질적 미스매치가 핵심 병목임을 확인했으며, SDICI를 활용해 기업을 4개 유형으로 구분하고 임계 구간(50점 전후) 기업을 집중 지원하는 등 성과 기반의 정책 고도화를 제안한다.
본 연구는 텍스트-이미지 확산모델이 자연어 프롬프트를 그럴듯하게 생성하더라도, 복합/구문 구조가 포함된 프롬프트의 세부 의미 제약(객체 누락, 엔티티 병합, 수량 오류, 속성 결합 오류 등)을 정확히 만족하지 못하는 문제에 동기한다. 핵심 기여는 (1) 학습 없이 추론 단계에서 잠재공간(latent space) 내 denoising 동안 noun-phrase-aware cross-attention 목적함수를 활용해 객체 존재, 속성 결합, 엔티티 간 공간 분리를 개선하는 방법과, (2) 프롬프트-이미지 의미 정렬을 전역 유사도 1점으로 평가하지 않고 프롬프트를 명시적 의미 제약으로 분해한 뒤 영역을 근거화하고 제약별 yes/no 시각 질의응답으로 검증하는 구조화된 평가 프레임워크이다. 실험은 통제된 조합(compositional) 프롬프트 세트에서 단순 Stable Diffusion 및 더 간단한 attention-guidance 대비 추론-단계 잠재공간 정제가 의미 정렬을 개선함을 보이며, 전역 유사도 지표로는 잘 드러나지 않는 실패 양상을 범주별로 진단 가능하게 한다. 한계로는 통제된 프롬프트 기반 성능 검증에 상대적으로 의존하며, 실제 사용 환경의 다양한 프롬프트/데이터 분포에서의 일반화와 평가 파이프라인의 외부 적용성은 추가 검증이 필요하다. 정책/규제·국가 전략 측면에서는, 생성형 모델의 “의미적 정확성”을 전역 점수보다 세부 제약 단위로 측정·감사할 수 있는 평가 체계가 안전성(오정보/오해 유발 가능성)과 품질 보증 체계에 활용될 여지가 있다.
DTap은 Google Workspace, Paypal, Slack 등 실제 시스템을 모사하는 50개+ 시뮬레이션 환경과 14개 도메인을 포함하는, 제어 가능·상호작용형 에이전트 레드팀 플랫폼을 제시한다. 또한 DTap-Red라는 자율 레드팀 에이전트를 통해 프롬프트/툴/스킬/환경 등 다양한 주입 벡터를 체계적으로 탐색하고 악의적 목표별 공격 전략을 발견하며, 그 결과를 검증 가능한 저지와 함께 모아 DTap-Bench(대규모 레드팀 데이터셋)를 구성한다. 다양한 백본 기반 인기 AI 에이전트를 대상으로 보안 정책·위험 범주·공격 전략 전반에서 대규모 평가를 수행해 취약점의 체계적 패턴을 관찰한다.