GPQA 88.5% · SWE 76.7% · MMLU 81.2% · HE 94.1% · MATH 95%
xAI flagship API model. 2M token context. Four-agent and 16-agent (Heavy) multi-agent variants. Reasoning on/off toggle. $2/$6 per 1M tokens. Superseded in SuperGrok Heavy chatbot by Grok 4.3 Beta (Apr 17), still primary via API.
인도 AI Impact Summit 2026은 글로벌 사우스에서 처음 열린 대규모 AI 정상회의로, AI 안전 중심 논의에서 발전·접근성·포용성 중심으로 의제를 확장했다. 80여 개국이 서명한 ‘AI Impact Declaration’은 AI를 글로벌 공공재로 규정하고 자원 접근성, 역량 구축, 형평성을 핵심 원칙으로 제시했다. 보고서는 한국이 인도 등 주요국과의 정책 대화와 공동 프로젝트를 확대하고, 개발도상국 대상 AI 역량 강화 지원을 ODA와 연계할 필요가 있다고 제안했다.
중국 국가컴퓨터네트워크긴급대응기술팀/조정센터(CNCERT) 등 사이버 보안 기관들은 최근 전국적인 도입 열풍이 불고 있는 AI 에이전트 '오픈클로'의 심각한 보안 및 데이터 유출 위험을 경고. 빅테크와 지방정부가 앞다투어 오픈클로 도입과 보조금을 지원하고 있으나, 높은 시스템 권한을 요구하는 자율적 특성상 프롬프트 인젝션이나 조작 오류로 인한 데이터 손실 위험이 있다고 지적.
메타 감독위원회는 이스라엘-이란 분쟁과 관련해 피해를 과장한 AI 가짜 영상이 조치 없이 방치된 사례를 비판하며, 조작된 AI 콘텐츠에 대한 선제적 라벨링 강화를 메타에 촉구. 특히 무력 충돌 등 중대한 상황에서는 대중의 정보 신뢰가 훼손될 수 있으므로, 사용자 신고에 의존하던 기존 방식을 버리고 고위험 AI 콘텐츠를 전면적으로 식별할 것을 권고.
마이크로소프트는 미 국방부가 앤스로픽을 공급망 위험 기업으로 지정해 사용을 전면 금지한 조치를 막아달라는 가처분 신청에 지지 의견서를 법원에 제출. 마이크로소프트는 이 갑작스러운 금지령이 미군의 첨단 AI 사용을 방해하고 기존 계약의 급격한 변경을 초래할 수 있다며, 원만한 해결을 위한 협상 시간이 필요하다고 주장.
브루킹스 연구소의 제드 콜코는 현재 AI가 고용에 미치는 영향을 다룬 초기 연구들은 엇갈린 결과를 보이며, 결정적 결론을 내리기에는 아직 도입부(First inning)에 불과하다고 분석. 단순한 노동 수요 변화뿐만 아니라 생산성 향상, 노동 공급의 변화 등 다양한 경로를 반영한 심층적인 연구와 함께, 이를 뒷받침할 고품질의 데이터 인프라 구축이 시급함을 제안.
RAND 연구소는 글로벌 AI 위험을 통제하고 이점을 극대화하기 위해 국가 간 전략적 협력이 필수적이라며 연구, 표준 설정, 모니터링, 검증이라는 4가지 핵심 기능을 제시. 기존 17개 국제기구 사례 분석을 바탕으로, 효과적인 협력을 위해서는 기능들이 목적에 맞게 결합되어야 하며 상황에 따라 유연하고 다양한 구현 및 검증 방식이 적용되어야 한다고 조언.
요약: 연구에 따르면, 2024년 중반부터 2025년 중반까지 생성된 에이전트 작성의 SWE 벤치 통과 PR 중 약 절반은 유지 관리자에 의해 주 메인 브랜치에 병합되지 않을 것으로 나타났다. 이는 벤치마크 점수만으로 에이전트의 실제 세계 유용성을 과대평가할 수 있음을 시사하며, 피드백을 통한 반복적 개선 과정이 인간 개발자와 달리 에이전트에게 주어지지 않기 때문으로 해석된다. 연구는 벤치마크 점수 해석에 주의를 요하며, 이를 실제 AI 능력과 연결 짓는 것은 복잡하고 여러 미묘한 문제점이 있음을 강조한다.
총격은 2026년 2월 10일 텀블러 리지의 학교에서 발생했으며, 피해자 가족은 OpenAI가 ChatGPT에서 총기 관련 폭력 시나리오를 언급한 정황을 충분히 막거나 경찰에 알렸어야 했다고 주장한다. OpenAI는 계정 활동이 “credible or imminent planning”을 보여주지 않아 계정을 정지했지만 당국에는 알리지 않았고, 이후 다른 계정도 확인했다고 밝혔다. 한편 브리티시컬럼비아 주지사와 시장은 OpenAI의 사과와 함께 안전기준을 강화하고 RCMP 보고가 이뤄지도록 하는 변화를 요구하고 있다.
PostTrainBench는 AI 에이전트가 다른 모델을 학습하는 작업을 수행할 수 있는지 테스트하기 위한 벤치마크를 소개하며, 관련 연구에서 얻은 학습 내용과 방법을 정리한 글이다. 본문은 PostTrain AI를 활용해 무엇을 확인했는지와 벤치마크의 도입 취지를 설명하는 데 초점을 둔다.
유튜브는 AI-generated deepfake를 식별하는 likeness detection 기술을 정부 공무원, 정치 후보, 언론인으로 구성된 파일럿 그룹에 확대한다고 밝혔다. 파일럿 참여자는 무단 AI 생성 콘텐츠로 판단되면 유튜브 정책 위반 여부를 근거로 삭제 요청을 할 수 있으며, 탐지 방식은 AI로 생성된 인물 얼굴을 찾아내는 것으로 Content ID와 유사한 구조다. 다만 요청된 모든 매칭이 자동 삭제되는 것은 아니고, 유튜브가 개인정보 보호 정책 기준에서 패러디나 정치적 비판 등 보호되는 표현인지 평가해 처리한다. 또한 파일럿 사용자는 본인 확인을 위해 셀카와 정부 신분증을 업로드해야 하며, 라벨 표시는 영상 설명 또는 전면 배치 등 일관되지 않지만 AI 생성 콘텐츠에 동일한 접근을 적용한다고 설명했다.