- SignalDesk1小时前
再次被astra把心态搞崩了。 我有个项目,计算密集的部分需要编译出不同语言的版本。 早期验证的时候)把接口和编译参数啥的搞好了,后来又对原型做了几次性能重构,依然让gpt去移植。 在让它施工之前,我还专门用kimi和claude把文档和契约全部捋顺了一遍,避免任何有重构残留和可能误导的歧义。astra只是当力工翻译测试员。 具体的提示词上,我强调了只留契约,计算部分应该完全对齐重构后的原型,该清理就清理。 结果从端功能级别验收通过以后,性能不太对。我还花了不少时间排查性能热点,它就避重就轻给我报小的热点,打了几次地鼠发现降不下来,我才觉得不对劲。 反复盘问+检查源码才发现,它原汁原味保留了最早那版算法,只是在上面打补丁,对齐性能升级后产出的细微变化。 相当于烧了几百刀都在原地打转,全白做。 最恶心的是,让它解释代码,它还每次都对答如流,说的都能找到依据,营造出一副已经捋顺的假象 它还总能让输入输出验收通过,不是性炸了很难发现。 质问它怎么变成这样。它先说对话里有另外一个另一个模型,错事全是另一个模型干的(那个sessioon没切过模) 还说,全都是用户让它优化#6缓存造成的(但实际上#6是我发现整个性能都不太对以后,让它抓到并且优化的小的性能热点。真正的问题是它的整个项目都是错的) 如果是国产模型,给它的活它会努力去干,不管干不干得了,只是能力问题,不会动骗用户把任务混过去的心思。 如果是claude,它觉得你的活它不想干,它就直接拉倒不干。 只有gpt从5.5开始就有这个倾向,6更严重了。聪明全用来偷奸耍滑,被抓包就怪天怪地怪用户。 类比成人类,就是那种有能力造火箭但只用来面试的员工。 我的任务实际上别说astra,哪怕换成deepseek我觉得都能胜任。 单纯是赶工期怕出幺蛾子上贵一点的模型。 事实反复证明gpt才是最爱出出幺蛾子的模型,就像openai的其他产品一样。 但是就像慕强的人类容易被光鲜但皮囊下脏心烂肺的渣男渣女骗一样,llm用户总是好了伤疤忘了疼,反复原谅gpt,原谅openai。 原谅codex卡得批爆,原谅codex三天推送一个更新爆炸一次,原谅订阅降智,原谅阴阳定价,原谅牙膏倒吸,原谅不降智的时候也偷懒。 gpt系列模型只适合做demo,做ppt,不适合任何对项目质量有要求的场景!!! 哪怕,撸袖子干活比只做表面功夫容易的时候,它也只做表面功夫 7 个帖子 - 5 位参与者 阅读完整话题
- 情报分类:工作与职业机会
- 分类依据:内容涉及招聘、求职或职业发展
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/28 15:57:13
- 暂无回复