선형 프로브 페널티로 LLM의 아첨 성향 감소 (2024.12.14)
ETH 방문 석사과정 학생 Henry Papadatos와 CHAI 박사과정 학생 Rachel Freedman이 NeurIPS SoLaR 워크숍에서 해당 논문을 발표했다. 논문은 RLHF fine-tuning으로 충분히 억제되지 않는 LLM의 원치 않는 행동을 줄이는 일반화 가능한 방법론을 제시한다.
ETH 방문 석사과정 학생 Henry Papadatos와 CHAI 박사과정 학생 Rachel Freedman이 NeurIPS SoLaR 워크숍에서 해당 논문을 발표했다. 논문은 RLHF fine-tuning으로 충분히 억제되지 않는 LLM의 원치 않는 행동을 줄이는 일반화 가능한 방법론을 제시한다.