AI 안전 다이제스트

파이프라인 전체 구조 한눈에 보기

이 사이트는 매일 오전 10시와 저녁 10시에 자동으로 도는 파이프라인 하나가 만듭니다. 결과는 나중에 다시 찾아보거나 MCP로 검색할 수 있는 이 공개 웹사이트에 쌓입니다. 아래 도식은 그 전체 흐름 — 언제, 어디서 무엇을 모으고, 어떻게 분석해서, 결과가 어디에 어떻게 나타나는지 — 를 한 장으로 정리한 것입니다.

10:00 · 22:00 launchd매일 두 번0 · 어제자 날짜 재배치reallocate_digest_by_date.py0a · 전체 날짜 재배치 스캔reallocate_digest_by_date.py --scan-all0b · 주간 하이라이트(월요일만)export_weekly_summary_html.pyOpenRouterClaude Sonnet 5 (하이라이트)0c · digest HTML(재배치 있을 때만)export_digest_html.py --all1 · 글로벌 뉴스 수집main.py · RSS·스티비 · 86곳원본 저장global_ai_news_list.csvstate/collect_status.json1a 프론티어 모델check_frontier_models.py1b MSIT·IITPnotify_msit_titles.py1c 연구 논문collect_research_papers.py2-3 · Raindrop 대기열 CSVdedupe → export (처리분은 삭제)4 · 요약 (LLM)summarize_new_links.pyOpenRouterGPT-5.6 Luna (요약)4a · 오늘분 게재일 재배치reallocate_digest_by_date.py --date 오늘4a2 · 같은 사안 묶기cluster_digest_stories.py --from-touchedOpenRouterGPT-5.6 Luna (애매한 쌍만 검증)4b·4b2 · 코퍼스+검색 인덱스export_knowledge_base.py · build_index.pyOpenRouter임베딩 APIMCP 서버Claude Desktop 연동digest.db 검색온디맨드 조회4c · digest HTML(--all)export_digest_html.py --all사이트 분류소스 리본(+아카이브)주제·한국 모아보기·주간 추이4c2 · 영문 한국 랜딩이번 달+어제 · 안 바뀐 날은 캐시OpenRouterGPT-5.6 Luna (영문 한국)4d · 공개 저장소 pushpublish_digest_html.shGitHubsongkyungho/ai-safety-digestGitHub Pages 공개 사이트songkyungho.github.io/ai-safety-digest
매일 10시·22시 launchd 트리거로 시작해 어제자 날짜 재배치 → 전체 날짜 재배치 스캔(오탐지된 날짜가 있으면 매일 자동 고침) → (월요일에만) 지난 한 주(월~일) 주간 하이라이트 생성 → 재배치가 있었을 때만 전체 HTML 재생성 → 86개 피드 수집(프론티어 모델·MSIT/IITP·KDI 경제정보센터·연구논문 병렬 수집 포함) → Raindrop 수동 대기열 → OpenRouter(GPT-5.6 Luna) 기반 LLM 요약 → 오늘분 게재일 재배치 → 같은 사안 묶기(제목 유사도로 후보를 넉넉히 뽑고, 애매한 쌍만 OpenRouter에 본문 일부까지 줘서 "정확히 같은 사건이냐"만 확인 — 하루치를 한 번에 통짜로 분류시키는 것보다 쌍 하나만 놓고 판단시키는 게 훨씬 신뢰도가 높았다) → 지식 코퍼스/검색 인덱스 구축(OpenRouter 임베딩, MCP 서버로 Claude Desktop에서 온디맨드 검색) → digest HTML 전체 재생성(소스 리본: 공공·기업·언론·아카이브 등, 주제·한국 모아보기와 주제 주간 추이) → 영문 한국 랜딩(en.html, 이번 달+어제, 캐시) → 공개 저장소 push를 거쳐 GitHub Pages에 게시되는 전체 과정. 정보통·Last Week in AI·EU AI Act 뉴스레터 같은 묶음 브리핑은 발행 주체가 아니라 아카이브 리본으로 모은다. 하이라이트는 매일이 아니라 매주 월요일에 지난 한 주치를 모아 만든다 — 하루 단위로는 재배치 시차 때문에(그날 파일이 하이라이트를 뽑는 시점엔 아직 다른 날 기사가 섞여 있음) 완결된 그림이 안 나온다는 한계가 있었다. 종합 한 줄 요약 아래 신규 모델·소버린AI/안보·법과 가이드라인·안전연구소·사건사고·안전기술 6개 주제로 나눠 정리하고, 실제 후보가 있는 주제만 표시한다.

수동 도구 스케줄 없음

스크랩마스터 단독 재수집run_scrapmaster_pipeline.sh그날따라 스크랩마스터 목록이 정각 수집에도 안 올라왔을 때
주간 하이라이트 백필 / 강제 재생성export_weekly_summary_html.py --week-start(월요일) ... [--force]과거 주차 하이라이트를 새로 만들거나 캐시를 무시하고 다시 뽑고 싶을 때
프론티어 모델 백필backfill_frontier_models.py과거 출시 모델을 실제 출시일 기준으로 한 번에 채워 넣을 때
K-AISI 주간동향 반영import_k_aisi_weekly_xlsx.py <엑셀경로> [--dry-run]실(팀)에서 정리한 모니터링 엑셀을 받았을 때 — 요약 없이 URL 중복만 체크 후 반영
영문 한국 랜딩 월별 백필export_digest_html.py --korea-en-only --korea-en-month YYYY-MM한 달치를 한 번에 다시 뽑을 때(매일 파이프라인은 이번 달+어제만)

수집 대상 (71개 기관·소스)

매일 수집하는 피드 URL은 86곳입니다(NIA·KISDI 게시판처럼 한 기관이 여러 URL인 경우 포함). 가능하면 RSS/Atom을 쓰고, 스티비처럼 공개 피드가 없는 목록은 Playwright로 모읍니다. 사이트 전체 뉴스는 제목 AI 키워드 필터와 적합성 게이트를 탑니다. 묶음 브리핑은 아래 아카이브 그룹에 모아 두고, 카드는 소스 리본이 아니라 아카이브 리본으로 갑니다. URL 단위 전체 목록은 파이프라인 저장소의 SCRAPED_WEBSITES.md에 있습니다.

AISIAISI-UK, AISI-Japan, AISI-Korea, SG-AISI
국제기구EU Digital Strategy, OECD-AI, ITU AI for Good
정부기관NIST, FTC, DSIT, CMA, Digital Agency JP, CAO JP, EDPB, CNIL
연구기관Stanford HAI, CHAI, METR, RAND, CSET Georgetown, Epoch (Substack), Institute for Law & AI, Redwood Research, CAIS, FLI, IAPS, Turing Institute, Concordia AI, AI Now, RIETI
NGOPartnership on AI, The Future Society, EU AI Act (FLI)
아카이브(묶음 브리핑)Japan AISI 정보통, Last Week in AI, EU AI Act Newsletter, Alisar Policy Newsletter, Ctrl+AI+Reg, IITP 주간기술동향, AI Safety Library
미디어GeopoliTechs, AI Frontiers, Tech Policy Press, AI-Ethics-KR, Transformer News, ChinAI, ChinaTalk, Alisar Mustafa(에세이), Select Digest, Weekly deep daiv
DBGlobalAIRegTracker, AI Risk Explorer, AIID, AI Lawsuit Tracker
기업Anthropic, Anthropic Research, DeepMind, OpenAI, Mistral
한국 기관MSIT, IITP, NIA, KISA, SPRi, KISDI, KDI-EIEC
한국 언론 클리핑스크랩마스터(IITP 뉴스클리핑), 뉴스RSS(국내 언론 24개사 합본)
연구 논문/보고서arXiv, OpenAlex, HuggingFace Daily Papers

최근 수집 상태

2026-09-14 · 86/86 성공

실패한 피드 없음.