目前主流的上下文压缩都是 压缩指令 原文 这样会打断巨量的token缓存 产生一次全额费用 而原文 压缩指令 从语料准备、注意力和训练上都是比较自然的 毕竟已经不是system prompt时代了 不知道为什么没往这一块发展 是因为它的效果很不好吗 3 个帖子 - 3 位参与者 阅读完整话题