- SignalDesk2 hr ago
Original Summary
Tensorized value iteration for a stochastic treasure-hunt MDP and tabular Q-learning with optimistic priors for highway driving.
中文概览
中文标题: MDP规划与强化学习
针对随机寻宝MDP的张量化价值迭代,以及带乐观先验的表格Q学习用于高速公路驾驶。
- 情报分类:技术学习与提效
- 分类依据:强化学习与MDP算法实现,偏技术学习
- 信息来源:GitHub · AI 新项目
- 发布时间:2026/10/8 18:01:47
- No replies yet