背景
大家在使用大模型的时候有没有这样一个困惑:推理强度(reasoning.effort)我应该怎么选?选择Max,额度很快用光,选择Medium又担心任务不能完美解决。

最近我看到一篇文章《Using Claude Code: Spending your effort》,作者 Thariq Shihipar,在 Anthropic 从事 Claude Code 的开发。
结论
low 快速协作头脑风暴,medium 日常开发,high 边界情况多的查错防漏,xhigh(extra) 复杂任务独立长时间推进,max 自主攻克顽固难题。
原文要点
effort 调高,主要换来的是更多验证和边界情况测试,而不是更聪明的核心推理。 方法本身选错了,调高 effort 救不回来;方法对但漏了边界情况,调高 effort 很有用。
- effort 是什么
- effort 告诉模型你愿意为这个任务花多少算力。作者打了个比方:给人 12 小时和给 1 小时,对方的做法完全不同。给 12 小时,他会全力投入、反复检查;给 1 小时,他会先快速拿出一版。
- effort 越高,Claude 越会自己做判断、自己做验证,但也会替你做更多假设。
- 档位共五个:low / medium / high / xhigh / max。
- effort 曲线
- 在 Terminal-Bench 3.0 上,两个模型的得分都随 effort 升高而稳定上升,token 消耗也同步增加。
- 同一批任务的 token 中位数:low 约 7.3 万,max 约 22.2 万,大约 3 倍。
- 三个做功能的实验
| 任务类型 | 低 effort | 最高 effort |
|---|---|---|
| 需求模糊(做一个健身 App) | 1.5 分钟,只有基础的记录和图表 | 67 分钟,做出了很精致的热力图等可视化 |
| 需求较轻(重新设计配置菜单) | 1 分钟,快速出几版概念草图 | 28 分钟,出了打磨好的设计稿,还附上工作流说明 |
| 需求很详细(先访谈再做健身 App) | 各档结果基本一致 | 只多了些细节打磨,没有本质区别 |
要点: 需求越模糊,effort 对结果影响越大,因为高 effort 等于让模型替你补全需求。需求写清楚以后,effort 的差别就小了。
作者推荐的做功能流程: 先访谈、把需求问清楚 → 用 low 快速实现 → 你自己审阅、迭代 → 最后切到 high 做验证。
- 难题和边界情况
在 Terminal-Bench 3.0 上按领域看,从低 effort 到高 effort 的通过率提升如下:
| 领域 | 通过率变化 |
|---|---|
| 安全 | 64% → 87% |
| 硬件 | 34% → 75% |
| 机器学习 | 54% → 73% |
| 科学计算 | 41% → 61% |
| 软件工程 | 43% → 56% |
| 媒体 | 18% → 30% |
| 运维 | 12% → 22% |
硬件、安全这类特别依赖验证和边界测试的领域,收益最大。
四个案例(每题跑 5 次的通过次数):
- HTML/JS 过滤器(sanitizer):1/5 → 5/5(xhigh)。高 effort 下,模型会自己做对抗性审查、去读解析器源码、跑测试套件,还做了 fuzzing。
- 两阶段单纯形求解器(CLI):0/5 → 5/5。模型拿暴力解法当参照做压力测试。
- GSEA 蛋白组学数据分析:0/5 → 4/5。模型尝试了多种预处理方法。
失败归因: 文章把失败分成两大类。
- 漏掉边界情况:包括"在我机器上能跑"、"只拟合了示例"、"测试没覆盖到的 bug"等。这一类调高 effort 会明显减少。
- 方法本身错了:包括"误读需求"、"领域规则理解错"、"选错了理解方向"等。这一类调高 effort 基本解决不了。
- 各档位怎么选
下表是我根据全文整理的,文章本身没有这张原表:
| 档位 | 适用场景 |
|---|---|
| low | 头脑风暴、画草图、常规小改;也适合你想全程参与、盯着每一步的时候 |
| medium | 常规功能开发 |
| high | 复杂代码库里修 bug、对边界情况敏感的任务 |
| xhigh / max | 你希望完全不用插手、让它自主完成;安全相关的工作(比如找漏洞);陌生领域的任务 |
- 实用提示
- 在 Claude Code 里用 /effort 可以在对话中途随时切换档位。
- 新一代模型切换 effort 不会让 prompt cache 失效,所以中途调档不用付缓存重建的代价。
- 如果任务有明确的规则可循,effort 影响很小;如果任务需要探索或验证,effort 影响最大。
- 你想全程参与时用低到中档,想放手让它自主干时再上最高档。
突发奇想
当我们调用API的时候,为了省钱命中 Prompt KV cache,同时问题很难又必须换模型或推理强度时,会遇到2种情况:
- 同一个 session、同一个模型,频繁切换 effort
可以命中cache,这件事在最新 GPT-6 、Claude Fable 5.1、Mythos 5.1、Opus 5.5系列上是专门支持的。之前的模型都不支持。
- 同一个 session,不同模型频繁切换
上下文可以保留,但 cache 不能跨模型复用