#model-based-rl

총 2개의 글

AI 2026.05.03 · 13 min Advanced Deep Rl Deep Dive · 6

6개 컴포넌트의 직교성부터 분산 학습, 잠재 공간 계획까지, Rainbow 이후 DQN 계보가 공유하는 하나의 설계 철학을 추적한다.

AI 2026.04.28 · 12 min Advanced Advanced Rl Deep Dive · 7

OOD 문제를 pessimism으로 해결하는 CQL, BC 정규화를 쓰는 TD3+BC, 상상 롤아웃으로 샘플 효율을 높이는 Dreamer, 그리고 RLHF·DPO가 공유하는 하나의 원칙을 추적한다.