Skip to content
yourassist.cn
• 5 min read

额度总不够用?大模型推理强度 5 档怎么选

背景

大家在使用大模型的时候有没有这样一个困惑:推理强度(reasoning.effort)我应该怎么选?选择Max,额度很快用光,选择Medium又担心任务不能完美解决。

GPT-6 Astra 的推理强度选择器
GPT-6 Astra 的推理强度选择器

最近我看到一篇文章《Using Claude Code: Spending your effort》,作者 Thariq Shihipar,在 Anthropic 从事 Claude Code 的开发。

结论

low 快速协作头脑风暴,medium 日常开发,high 边界情况多的查错防漏,xhigh(extra) 复杂任务独立长时间推进,max 自主攻克顽固难题。

原文要点

effort 调高,主要换来的是更多验证和边界情况测试,而不是更聪明的核心推理。 方法本身选错了,调高 effort 救不回来;方法对但漏了边界情况,调高 effort 很有用。

  1. effort 是什么
  1. effort 曲线
  1. 三个做功能的实验
任务类型 低 effort 最高 effort
需求模糊(做一个健身 App) 1.5 分钟,只有基础的记录和图表 67 分钟,做出了很精致的热力图等可视化
需求较轻(重新设计配置菜单) 1 分钟,快速出几版概念草图 28 分钟,出了打磨好的设计稿,还附上工作流说明
需求很详细(先访谈再做健身 App) 各档结果基本一致 只多了些细节打磨,没有本质区别

要点: 需求越模糊,effort 对结果影响越大,因为高 effort 等于让模型替你补全需求。需求写清楚以后,effort 的差别就小了。

作者推荐的做功能流程: 先访谈、把需求问清楚 → 用 low 快速实现 → 你自己审阅、迭代 → 最后切到 high 做验证。

  1. 难题和边界情况

在 Terminal-Bench 3.0 上按领域看,从低 effort 到高 effort 的通过率提升如下:

领域 通过率变化
安全 64% → 87%
硬件 34% → 75%
机器学习 54% → 73%
科学计算 41% → 61%
软件工程 43% → 56%
媒体 18% → 30%
运维 12% → 22%

硬件、安全这类特别依赖验证和边界测试的领域,收益最大。

四个案例(每题跑 5 次的通过次数):

失败归因: 文章把失败分成两大类。

  1. 各档位怎么选

下表是我根据全文整理的,文章本身没有这张原表:

档位 适用场景
low 头脑风暴、画草图、常规小改;也适合你想全程参与、盯着每一步的时候
medium 常规功能开发
high 复杂代码库里修 bug、对边界情况敏感的任务
xhigh / max 你希望完全不用插手、让它自主完成;安全相关的工作(比如找漏洞);陌生领域的任务
  1. 实用提示

突发奇想

当我们调用API的时候,为了省钱命中 Prompt KV cache,同时问题很难又必须换模型或推理强度时,会遇到2种情况:

可以命中cache,这件事在最新 GPT-6 、Claude Fable 5.1、Mythos 5.1、Opus 5.5系列上是专门支持的。之前的模型都不支持。

上下文可以保留,但 cache 不能跨模型复用