AI 안전 다이제스트

2024-12-14 · 1건

선형 프로브 페널티로 LLM의 아첨 성향 감소 (2024.12.14)

공공 · 인간 호환 인공지능 센터(CHAI) · 🧪

ETH 방문 석사과정 학생 Henry Papadatos와 CHAI 박사과정 학생 Rachel Freedman이 NeurIPS SoLaR 워크숍에서 해당 논문을 발표했다. 논문은 RLHF fine-tuning으로 충분히 억제되지 않는 LLM의 원치 않는 행동을 줄이는 일반화 가능한 방법론을 제시한다.