- SignalDesk1小时前
预训练大模型,再通过强化学习 增加推理时计算继续提高能力. 这种结构是不是会导致一步错步步错的窘境: 正确性、格式、偏好评分都可以成为训练信号。 但理解一个模糊问题、发现用户前提错误、判断什么时候该直说,往往更难准确计分。 OpenAI 的强化学习微调文档也明确提醒:模型可能学会获得高分,却没有真正答对。 正确回答问题 却 不能解决问题 。 我已经不是第一次发现GPT把问题润色一遍再还给回来了。 你可以在下图中找出GPT模型吗? 提问:为什么OpenAI会变成今天这样 从左到右依次是 Claude Gemini GPT Gemini的模型确实老了3.1Pro,但文章的引力依旧, Claude则侧重填充内容信息密度。 GPT我一时半会不知道他是在做检讨还是帮我细化问题让我好好想想。 如果OAI坚持用臭长的COT试图轰开城墙,我觉得很有一天他们会被规模不足还有资金短缺等等现实问题熬死,根本等不到GPT豁然开朗的那一天。 最近OAI的很多行为也能看出他们背后巨大的经济压力,砍了额度、重置活动萎靡、甚至推出夸张的ProMax500刀套餐,鼓励用户购买额度重置。我真的觉得这家企业已经处在摇摇欲坠的边缘。 不知道 你是怎么看的 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/10/4 21:36:21
- 暂无回复