总结: DeepSeek-V4 / V4.1 中的实证证据(第2节) 代码补全例子:让 DeepSeek-V4-Flash-Base 补全它自己的 FP8 量化推理代码,仅改变前置装饰性 docstring 的长度(1个token),首选补全就在 “8”(正确)与 “32”(错误)之间以4为周期翻转(即其压缩步长 S=4)。四种 filler 家族、后训练版本(0731、V4.1)均复现,周期分别匹配各自步长;无分块压缩的 DeepSeek-V3.1-Base 无此模式。 NIAH 检索评测:128K token、16k 键值对,按目标键位置 mod 8 分组,组间查询位置、prompt 长度、目标位置均值/方差严格匹配。结果:基座模型各相位检索精度差距最高达 40.2 个百分点;后训练收窄但依然显著(19.1pp);V4.1-Flash 差距最小(6.1pp)但所有偶数残差组精度高于全部奇数组。 论文链接: [2609.36322] Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression 1 个帖子 - 1 位参与者 阅读完整话题


  • 情报分类:技术学习与提效
  • 分类依据:内容涉及技术、AI、软件工具或工程实践
  • 信息来源:服务器 / LINUX DO - 最新话题
  • 发布时间:2026/10/8 19:57:38