AI 안전 다이제스트

2024-12-25 · 1건

멘토의 도움으로 목표 일반화 실패 극복하기 (2024.12.25)

공공 · 인간 호환성 AI 센터(CHAI)

이 논문은 에이전트가 불확실할 때 도움을 요청하도록 하면 목표 일반화 실패를 완화할 수 있는지 탐구한다. 연구진은 현재 방법에 상당한 한계가 있지만, 대체로 완화 효과가 있다고 설명한다. 이 논문은 2024년 NeurIPS Safe & Trustworthy Agents 워크숍에 채택됐다.