Berkeley AI Research·2025-11-01 17:00· 2025-11-01AI 评分36无需 TD 学习的强化学习:用分治法扩展 off-policy RLAI 导读Berkeley AI Research 提出一种基于分治法的 off-policy RL 算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到任意长时程任务。正文阅读原文 当前提供 AI 导读,完整正文请阅读原文。来源:Berkeley AI Research · bair.berkeley.edu#论文/研究#推理