Tensorized value iteration for a stochastic treasure-hunt MDP and tabular Q-learning with optimistic priors for highway driving.
中文标题: MDP规划与强化学习
针对随机寻宝MDP的张量化价值迭代,以及带乐观先验的表格Q学习用于高速公路驾驶。