arXiv:2609.19170v1(新论文)提出,强调时序差分学习(Emphatic Temporal-Difference Learning, ETD)能稳定期望的离策略(off-policy)TD更新,并改变其投影几何,但这两者都不能决定常数步长下的采样动力学。作者构造了一个遍历的两状态反例:其中 ETD均值映射收缩,而采样乘积具有正的最高 Lyapunov指数。再生周期分析将该符号与后续迹(follow-on trace)的无限方差区分开。
为此,作者引入正则化强调 TD(Regularized Emphatic TD, RETD)。这是一种归一
来源:arXiv cs.AI