Berkeley AI Research·· 2025-11-01精选AI 评分62
Transitive RL:基于分治范式的强化学习算法
RL without TD learning
AI 导读
Seohong Park 在 Berkeley AI Research 博客介绍了一种基于分治范式的新型强化学习算法 Transitive RL(TRL),它不依赖时序差分(TD)学习,而是通过递归拆分轨迹来减少 Bellman 递归次数,从而更好地扩展到长程任务。
推荐理由
原文提出一种不依赖时序差分学习的强化学习新范式,并给出在长程任务上的实验结果,读者可据此评估其可行性。
来源:Berkeley AI Research · bair.berkeley.edu