在实际的思考链中发现 DeepSeek v4.1 flash 可能基本能力差一点,但配上合适的单元测试和 E2E 模拟真机测试工程化,经过超级雷霆大思考(普遍 5-10M tokens)最后结果很好,考虑周全。 唯一的问题是一个需求实现下来成本 1块+,和 GPT 价格接近了,而且我基本上是梁文谷时期采用,换上高峰期估计和 Pro 20x 价格打平了。 1 个帖子 - 1 位参与者 阅读完整话题