- SignalDesk5 days ago
事情的起因是我这边前段时间订阅了GLM的套餐。但是受限于5小时额度+周额度,感觉我整个人的身心都被Zcode绑定了。所以我决定了再次转为纯API调用。因为我这个人使用的频率不高,而且波动很大。我的探索也是很适合类似我这样需求的人(使用频率不高。但是波动大,有的时候这周额度用的精光,下周额度剩余99%) 既然要纯使用api调用,那么就要思考用谁家的api。 市面上的API来源有几种。 一种是官方API,类似各个大模型的提供商的开放平台。往里面充钱就能用。国内的DS,GLM,KIMI,qwen,minimax(这个性能太差了,暂不考虑) 一种就是聚合API,当然,我也懒得用脑子去思考,直接问AI。得到的结果是站长之家AI聚合。但是我一看发现主流模型这种稳定+企业背书的API便宜不了。因为我这边的主要使用场景是agent。甚至是多Agent协同。那么我就只呢把自己的目光放在官方API里面。调用API最重要的参数就是价格。kimi自然可以直接忽视。K3自不必多说K2.7code的价格也非常贵。而且没有官方运营的flash模型。qwen是我个人比较反感的一个平台。对的,纯反感,虽然所有大厂里面,阿里的qwen性能一直很稳定在国模前列。但是整个阿里因为商业气息很重的原因我不打算考虑。 那么性能+价格双重考虑的基础上,我能看的就只有两家,GLM5.3flash OR deepseek-flash。接下来就是实际使用情况+价格对比。这两家性能上其实大差不差。(说句实话,就性能差哪一点完全可以忽略)所以就要实际对比这两个的价格。首先看ds的 第一个是因为上下文过短显得有点低。实际情况可以看下面那个。也就是接近99%。按照99%去计算缓存命中。按照99w缓存命中1w输入去计算价格。低谷期大概是99w 0.02+1w 1约等于2.98元(Agent+多agent协同场景下输入远远大于输出,所以输出不计入价格参考。 下面是glm的,因为我这边使用glm的场景多是zcode,所以直接找几个zcode的项目的上下文拿出来。 可以看到最后的缓存命中大概是94%到97%。这个和ds的99%比起来还是有差距。同样,我们选择上下文占用最长的来用。也就是96.9% 按照缓存命中0.23+输入0.8的价格去计算,同样是百万 96.9w 0.23+3.1w 0.8=24.767.整个价格差了数量级的差距。所以如果没搞错的话,我这边这次glm套餐到期后就会彻底转入ds的api调用 2 个帖子 - 2 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/18 11:38:06
- No replies yet