最近有一个批量生产试题的活,拿Astra做,结果出完结果像在做火星语阅读理解,指导它改很多次,改到人绝望,永远都是“人看不懂的中文”,试题的可用性几乎为 0,也拿 gemini 3.8 试了,感觉出的效果疯疯癫癫的,还会拽词。刚刚又拿新的隐身模型试了下,发现效果不错。 感觉现在太多模型已经 agent rl 入脑,不会说话了。 1 个帖子 - 1 位参与者 阅读完整话题


  • 情报分类:技术学习与提效
  • 分类依据:内容涉及技术、AI、软件工具或工程实践
  • 信息来源:服务器 / LINUX DO - 最新话题
  • 发布时间:2026/9/17 09:36:49