AI 推理令牌:更多令牌,更好的结果,更大的能力
Tech
AI
OpenAI
Anthropic
Reasoning Models

AI 推理令牌:更多令牌,更好的结果,更大的能力

OpenAI 和 Anthropic 使得权衡变得更加明显:更好的 AI 答案通常需要更多的推理令牌、更多的推理计算和更多的电力。

Uygar DuzgunUUygar Duzgun
Jul 14, 2026
更新於 2026年7月24日
7 min read

AI 推理令牌正成为现代 AI 性能中最重要的部分之一。

OpenAI 和 Anthropic 现在比以往更清楚地揭示了这种权衡。OpenAI 有 `reasoning.effort`。Anthropic 有扩展思维和 `budget_tokens`。这两个控制指向同样的模式:在困难的任务中,更好的结果往往来自于给模型更多的思考空间。

这对编码、研究、规划、数学和代理工作流程都很有用。这也意味着 AI 行业正在将更多的工作转移到推理时间。更多的推理令牌意味着更多的加速器时间、更多的冷却、更多的数据中心容量和更多的电力。

我的理解很简单:模型竞赛正在变成基础设施竞赛。

什么是 AI 推理令牌?

AI 推理令牌是模型在解决问题时花费的令牌,这些工作是在最终答案之前或与最终答案同时进行的。这些工作中的一些可能对用户是隐藏的。你并不总是能看到推理文本,但提供者仍然必须运行计算。

OpenAI 的推理文档表示 `reasoning.effort` 控制模型执行多少推理。较低的努力倾向于速度和较少的令牌。较高的努力可以在复杂任务上产生更完整的答案。OpenAI 还解释说,推理模型可以使用隐藏的推理令牌,除了输入和可见输出令牌之外。

Anthropic 描述了与 Claude 扩展思维相同类别的权衡。它的文档表示 `budget_tokens` 设置 Claude 可以用于内部推理的最大令牌数。更大的预算可以改善复杂问题的响应质量,尽管模型可能不会花费全部预算,且在较高范围内收益可能会趋于平稳。

重要的区别在于:更长的最终答案并不是目标。更好的中间推理才是目标。

为什么更多令牌可以产生更好的 AI 结果

当推理模型有足够的预算来检查任务、测试可能的答案、纠正错误并使用工具而不急于求成时,它们会得到改善。小的令牌预算可以适用于简单的提示。当工作有隐藏依赖关系时,它往往会失败。

我在编码代理中最清楚地看到了这一点。一个便宜的快速通道可以重命名一个变量或解释一个小函数。当任务需要仓库上下文、测试、浏览器验证、部署约束以及关于不该触碰什么的判断时,同样的模式就会挣扎。

模型需要预算来做好无聊的部分:

阅读相关文件
将当前行为与请求的行为进行比较
进行小的更改
运行正确的检查
检查输出
如果第一次通过是错误的,则进行修订

该工作流程消耗令牌。它也比快速猜测产生更好的软件。

推薦閱讀

我在 21.54 亿令牌后的代码代理 中写过这个。我得到的有用教训并不是一个模型可以解决所有问题。围绕模型的系统很重要:上下文、工具、验证、记忆,以及足够的预算供代理使用。

OpenAI 和 Anthropic 正在将计算转变为产品设置

新的模型控制使智能感觉可调。

提供者现在可以从同一模型系列中提供不同的行为:快速回答、平衡回答、深度推理、长上下文代理工作或高努力工具使用。用户可能不关心内部令牌计数。产品仍然必须为此付费。

对于构建者来说,这改变了路由。你不希望在每个请求上都使用最大推理。

任务类型更好的默认值
------
格式化、提取、短重写低推理努力
正常研究、代码编辑、支持分析中等推理努力
生产代码更改、法律审查、财务逻辑高推理努力
具有工具和验证的多步骤代理扩展思维或更大的推理预算

这正是 OpenAI 和 Anthropic 正在趋同的地方。它们暴露了不同的 API 和产品语言,但都在教导构建者智能并不是一个固定的设置。这是一个预算决策。

推薦閱讀

这也是我在 OpenAI GPT-5.6 Sol, Terra 和 Luna与 Claude Fable 5 的 24 小时 等作品中思考模型路由的方式。最好的模型并不总是最大的模型。最佳路由是与任务匹配的路由。

推理令牌背后的基础设施问题

每个额外的推理令牌都必须在某处运行。

国际能源署估计,数据中心在 2024 年使用了约 415 TWh 的电力,约占全球电力消费的 1.5%。在其基本情况下,全球数据中心电力消费到 2030 年大约翻倍,达到约 945 TWh。国际能源署还指出,AI 驱动的加速服务器是未来需求的关键驱动因素之一。

时机是困难的部分。AI 公司可以快速发布模型更新、增加上下文限制或添加新的推理模式。电力生成、传输线路、变电站、冷却系统、土地许可证和水资源规划的速度则不同。

Gartner 的 2026 年预测,由 Tom's Hardware 报道,提供了另一个有用的信号。它预测到 2026 年全球数据中心电力使用量将达到 565 TWh,到 2030 年将超过 1,200 TWh。它还预计到 2026 年,AI 优化的服务器将使用 175 TWh,较 2025 年的约 95 TWh 增加,并预计到 2027 年将消耗比传统服务器更多的电力。

这些数字使得令牌故事变得具体。更多的思考意味着更多的推理。更多的推理意味着更多的 GPU、更密集的机架、冷却、电网接入和电力合同。

为什么数据中心和电力成为限制

公众的 AI 讨论集中在芯片上。芯片很重要,但它们并不是全部限制。

大规模推理模型需要完整的物理基础设施堆栈:

加速器供应
高密度机架
冷却系统
土地和许可
电网互联
长期电力合同
备用电源
区域之间的网络容量

一个模型可以在当地电网准备好之前就准备好。提供者可以在想要的密度之前购买 GPU。一个地区可以吸引数据中心投资,然后遇到传输瓶颈。

这就是为什么我预计将为 AI 建设大量新数据中心。我还预计在超大规模 AI 集群集中的地区,电力供应将面临更大的压力。限制不仅仅是模型架构。它将是电力、冷却、位置以及快速连接一切的能力。

更多推理令牌并不是免费的智能

这个趋势中有一个陷阱。

如果团队听到“更多令牌意味着更好的结果”,他们会过度使用高努力模式。这会使应用程序变得更慢且更昂贵。它还可能产生更糟糕的用户体验。一个在简单任务上思考太久的模型感觉是坏掉的。

实际规则更狭窄:当任务具有足够的隐藏复杂性时,更多的推理预算是有帮助的。

适合更大推理预算的良好候选者:

跨多个文件进行调试
规划迁移
审查带有警告的法律或财务文本
比较来源
运行多步骤工具工作流程
设计代理系统
决定是否应该进行更改

不适合的候选者:

短文本的摘要
标题创意
简单格式化
明显的代码编辑
自动完成式交互

未来并不是一个模型在每个请求上尽可能努力地思考。未来是系统决定何时更努力思考是值得成本的。

我的看法

AI 推理令牌使隐藏的权衡变得可见。

OpenAI 和 Anthropic 都在向用户展示相同的基本模式:更困难的任务需要更多的推理时间计算。开发者将其体验为推理努力、扩展思维、上下文窗口、隐藏令牌和更高的账单。基础设施团队将其体验为机架、冷却、电力、许可证和电网容量。

我认为下一个严肃的 AI 产品将把推理预算视为稀缺资源。它们将在错误代价高、验证重要或任务需要真正规划的地方花费它。它们将避免在简单请求上浪费。

更好的 AI 不仅仅来自更大的模型。它将来自更好地分配计算资源。

来源: