当你感觉模型降智了,模型厂商搞了什么鬼? 一个现象是,刚上线的模型往往很聪明,但一旦过了一段时间,可能是用户量变大,就开始“降智”。 评论区有个高赞、专业简短的回答,给了四种常见做法: (让AI解释了下) 手段一:路由到小模型(最明显) 系统判断用户问题难度。"你好""写个请假条"这类简单请求,会被路由到极低成本的小模型上。 只有复杂代码调试、长文本推理等任务才真正调用旗舰模型。 问题在于:系统判断"简单"的标准不可见,你觉得需要深度思考的问题,可能被判定为"简单"而发给了便宜模型。 手段二:调低 juice 值,减少思考 token Juice 值(社区俗称"果汁值")是 OpenAI 推理模型中一个隐藏参数,控制模型在回答前被允许思考多深。 正常满血版 gpt-5.5 xhigh 的 juice 约为 768,而被灰度到降配池的用户可能只有 128,缩水 6 倍。 思考预算少了,模型自然"想不深"。 参数官方没公开,是社区开发者从系统提示词中逆向提取出来的。 手段三:提前中断思考,强行回答 即使分配了思考预算,系统也可能在推理过程中提前截断,强制模型输出答案。 表现为:回答速度变快,但逻辑链条变短、缺少自我检查、容易在复杂问题上跳步或出错。 用户感知到的是"它好像没认真想就答了"。 手段四:MTP 增加小模型接受概率 Multi-Token Prediction(多 token 预测)机制下,系统会根据中间结果动态决定是否继续用大模型推理。 如果小模型的中间输出"看起来还行",系统就提高接受小模型结果的概率,提前终止大模型的深度推理。 在用户感知不到明显差异的边界上节省算力。 Theigrams : @vista8 1. 路由到小模型,最明显。2. 调低 juice 值,减少思考 token。3. 提前中断思考,强行回答。 4. mtp 增加小模型接受概率。 Link:


  • 情报分类:技术价值
  • 命中依据:讨论模型降智现象与厂商策略,对AI使用有参考价值
  • 来源:AI / AI前沿 / 向阳乔木 @vista8
  • 原作者:向阳乔木
  • 发布时间:2026/9/12 01:57:33