- SignalDesk2026-09-13
看了 V4.1-Flash 的技术报告,说一下它 Reasoning Effort 机制的重点。 Effort 现在是数字,三档只是预设 底层是一个 1–100 的标量。API 上还是 low / high / max 三个名字,但它们只是三个预设点, 分别是 50, 75, 100. 训练里只用了几个档位,但中间值也能插值生效——同一个模型,不换权重、不改采样参数,靠这个数字在「省钱」和「使劲想」之间滑动。 怎么实现的 说白了很朴素:在 system prompt 前面加一行「Reasoning Effort: N」,然后用 RL 把它练成行为。具体机制是奖励里有一个思考长度的惩罚项,effort 数字越高、每多写一个思考 token 挨的罚越轻。所以模型「想多久」是被这个数字直接调控的,而且单轮推理和 agent 任务用的是同一套机制。 实测效果(报告数据) effort 从 25 拉到 100: 8 项推理基准平均分:67.1% → 76.3% DeepSWE v1.1:66.0% → 74.2% Terminal-Bench 2.1:82.4% → 90.6% 代价:输出 token 约多 2.5 倍 关键是收益前置:60–80 这个区间用不到一半的 token 就能拿到大部分分数;从 80 拉满到 100,token 再多 1.6–1.8 倍,提升却只有边际。逐基准看最夸张的是 MathArena Apex:25.3% → 65.6%,而已经饱和的基准(比如 GPQA)几乎不动。 一个容易忽略的点:harness 的影响不比 effort 小 他们用 Claude Code、Codex、OpenCode、Pi、mini-SWE 等一堆 scaffold 测了同一模型:任务接近饱和时(Terminal-Bench 2.1),换 harness 带来的分差 ≥ 换 e
- 情报分类:技术价值
- 命中依据:DeepSeek论文思考强度解读
- 来源:服务器 / LINUX DO - 最新话题
- 原作者:sandiferresner
- 发布时间:2026/9/13 01:48:21
- No replies yet