如题,强化学习出现前期不太不稳,收敛后学习出小碎步前进,如何设计引导奖励函数可以避免这些问题。 2 个帖子 - 2 位参与者 阅读完整话题


  • 情报分类:技术学习与提效
  • 分类依据:内容涉及技术、AI、软件工具或工程实践
  • 信息来源:服务器 / LINUX DO - 最新话题
  • 发布时间:2026/10/4 10:02:53