- SignalDesk2 hr ago
MiMo-V3 即将采用全新架构。其核心 HySparse2 今日发布。 更少的预填充、更小的 KV 缓存、更出色的长上下文检索——我们一次实现了所有三者。 与 MiMo-V2.6 的 Hybrid SWA 架构相比: • 在 1M 令牌时,预填充 FLOPs 降低 5.02 倍 • 在 1M 令牌时,KV 缓存缩小 4.5 倍 • 更高的 MRCRv2 和 RULER-v2 分数,外加更低的 AgentPPL 和 LongPPL 为什么构建全新架构? 代理式推理是一种截然不同的工作负载。每轮中,简短的动作可能返回需要预填充的长观察结果,同时上下文持续增长。这使得预填充成本、KV 缓存大小和检索准确性同时成为关键路径。 HySparse2 通过两级 KV 共享机制同时应对所有三者: • KV Bridging:遵循 YOCO 的方法,跨解码器中的全注意力层从自解码器隐藏状态构建其 K/V。 • KV Reuse:在每个混合块内,稀疏层重用前序全注意力层的 KV 缓存和选择索引。 另外两项改动:令牌级选择取代块级选择,强制窗口内的近期令牌取代独立的 SWA 分支,因此本地和全局令牌共享一个 KV 缓存。由于所有跨解码器 KV 缓存现均来自自解码器,预填充可在自解码器完成后即停止。 来源: X 上的 Fuli Luo:“MiMo-V3 is getting a new architecture. The core of it, HySparse2, is out today. Less prefill, a smaller KV cache, better long-context retrieval—and we got all three at once. Compared with MiMo-V2.6’s Hybrid SWA architecture: • 5.02× lower prefill FLOPs at 1M tokens • 4.5× https://t.co/2tLCjaKPFX” / X 3 个帖子 - 3 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/25 14:38:31
- No replies yet