#parameterization

AI 2026.05.03 · 9 min Advanced Policy Gradient Deep Dive · 1

Value-based의 한계부터 stochastic 최적 정책의 필요성, softmax·Gaussian 파라미터화, 그리고 J(θ)의 세 가지 등가 정식화까지 Policy Gradient의 출발점을 추적한다.