- SignalDesk2026-09-09
NVIDIA 这篇论文我看完是真服了。 他们搞出了一招,让 KV 缓存能在不同模型之间通用,目标模型直接跳过 prefill,转换速度比重新算一遍上下文快 2.7 到 25 倍。 为啥这事大?现在 LLM API 都是无状态的,每次对话都得把整段聊天记录重发一遍按输入计费。Prompt 缓存能省九成,但缓存只认生成它的那个模型,一旦做模型路由切换,之前攒的缓存全废,得原价重算。 这篇论文干的就是把缓存翻译成另一个模型认的形式,闭式解,不用训练。 三个限制说清楚: 1️⃣ 目前只在同家族内验证,比如 Qwen 转 Qwen 2️⃣ 只测了 KV Head 数量和维度一致的模型对 3️⃣ 只支持稠密全注意力,滑动窗口那种还不行 🔗 https://arxiv.org/abs/2608.03893
- 情报分类:技术价值
- 命中依据:KV缓存跨模型复用技术,有明确技术价值
- 来源:AI / AI前沿 / Twitter @鸟哥 | 蓝鸟会🕊️
- 原作者:鸟哥 | 蓝鸟会🕊️
- 发布时间:2026/9/9 11:01:50
- No replies yet