最近经常看到有人说GPT/ChatGPT某个时间段“降智”了,但很多时候又很难分清到底是真有能力变化,还是随机性、路由、系统提示词、上下文、限流之类造成的体感波动。想问问现在有没有比较靠谱、可长期重复的测试方法?最好不是只靠“问几个熟悉的问题看看感觉”。我目前想到的是:固定一套prompt,模型、参数、上下文尽量保


  • 情报分类:技术学习与提效
  • 分类依据:内容涉及技术、AI、软件工具或工程实践
  • 信息来源:NodeSeek 最新主题
  • 发布时间:2026/9/13 13:52:33