AI 2026.05.03 · 12 min
Advanced Model Free Rl Deep Dive · 5
n-step Return에서 TD(λ)까지: 하나의 스펙트럼
TD(0)와 MC 사이의 연속체를 n-step return이 어떻게 매개변수화하는가. bias-variance 트레이드오프의 수학적 분해부터 eligibility trace의 세 가지 구현까지.
총 1개의 글
TD(0)와 MC 사이의 연속체를 n-step return이 어떻게 매개변수화하는가. bias-variance 트레이드오프의 수학적 분해부터 eligibility trace의 세 가지 구현까지.