오프라인 강화학습을 위한 지도학습에서 필수적인 요소는 무엇인가 (2025.1.18)
오프라인 강화학습에서는 temporal difference(TD) 학습 없이도 지도학습만으로 높은 성능을 낼 수 있으며, 두 층 feedforward MLP의 likelihood 최대화만으로도 복잡한 TD·Transformer 기반 방법과 경쟁력 있는 결과를 보였다. 성능을 위해서는 정규화나 구조를 통한 모델 용량 조절과 목표·보상 등 어떤 정보를 조건으로 사용할지 선택하는 것이 중요하다. 연구진은 이를 지도학습을 통한 강화학습(RvS learning)의 실용적 지침으로 정리했으며, 기존 RvS 방법이 무작위 데이터에서 상대적으로 약하다는 한계와 추가 연구 과제도 제시했다.