- SignalDesk5天前
之前一直找不到稳定的中转站, 无法对GPT-6 Astra进行整体测试, 有测试过静态分析能力, 今天看到Devin网页版老用户有点额度, 就用来测试GPT-6 Astra的整体能力 ![ScreenShot_2026-09-14_171107_297|690x454] (upload://9V8xgIUAsyBTFuyi42NeOOs6jVD.jpeg) 效果可对比往期: 第二期评测补充: Qwen-3.8, 没有那么差, 因为Qoder有问题 搞七捻三 之前快速使用了Qoder测试了一下,发现Qwen-3.8效果十分差, 所以很失望: 不过这次使用了Qoder2API: keirouter: 使用相同的系统提示词和用户提示词做测试: [image] 效果还可以, 所以之前有点错怪Qwen-3.8了, 现在使用IDE/CLI出来的效果十分差, 还不清楚是多轮的原因(因为使用IDE, 第一步都会先查看项目目录的情况)? 还是因为有… 第二期评测: GPT-5.6 Sol vs Kimi-K3 vs Qwen-3.8 国产替代 这个评测我做过了几期, 之前是GPT-5.5 vs GLM 5.2: 这次也是使用完全相同的提示词(系统+用户提交词), 这次使用的是API调用. Kimi K3 [k3] 我的系统提示词里有写必要时TDD开发, K3也写了个test, 这似乎不需要TDD 还写了一个迷你GLSL解析器, 这想得够多 用时确实比较长: [image] GPT 5.6 sol [5.6] 似乎… 因为使用的是网页版, 不是使用自定义的提示词, 而且有其他工具和skill等, 所以评测条件有一定差别. 效果我个人觉得GPT-6 Astra越来越精致(可能是skill影响), 而且逻辑更清晰, 功能更完整和丰富(可能是skill影响) 另, 测试使用Devin消耗了5.66美刀, 这消耗有点恐怖 2 个帖子 - 2 位参与者 阅读完整话题
- 情报分类:服务器与云资源
- 分类依据:内容涉及服务器、云资源或网络线路
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/14 17:12:48
- 暂无回复