Grok 4.5 与 GPT-5.6 Sol 和 Claude Fable 5:基准评判
Tech
Grok 4.5
SpaceXAI
xAI
GPT-5.6 Sol

Grok 4.5 与 GPT-5.6 Sol 和 Claude Fable 5:基准评判

Grok 4.5 以更低的成本达到了前沿。看看它在何处超越 GPT-5.6 Sol 和 Claude Fable 5,以及我为何保持当前的技术栈。

Uygar DuzgunUUygar Duzgun
Jul 18, 2026
更新於 2026年7月23日
9 min read

Grok 4.5 与 GPT-5.6 Sol 是本发布周期中首次将成本作为测试其他提供商的重要理由的比较。它仍然没有让我更换 OpenAI 或 Anthropic。

SpaceXAI 的最新模型达到了前沿,运行迅速,输入令牌每百万收费 2 美元,输出令牌每百万收费 6 美元。独立测试将其与领先的编码代理相近。相同的测试将其在整体智能上落后于 Sol 五分,落后于 Claude Fable 5 六分。

截至 2026 年 7 月 18 日,我的路线仍然是 OpenAI 第一,Anthropic 第二。Grok 4.5 进入了编码代理、自动化和高容量工作负载的受控测试通道。我尚未在生产中使用它,因此此比较将已发布的测量与我自己的路由决策分开。

简短评判

最佳整体智能: Claude Fable 5 在人工分析智能指数上得分 60。GPT-5.6 Sol 得分 59,而 Grok 4.5 得分 54。
最佳编码代理结果: Codex 中的 Sol 以 80 分领先。Fable 5 在后备情况下得分 77,而 Grok 4.5 在 Grok Build 中得分 76。
最佳成本: Grok 4.5 每个人工分析智能指数任务的成本为 0.31 美元,而 Sol 为 1.04 美元,Fable 5 为 2.75 美元。
我的选择: 我将继续将 OpenAI 作为我的主要编码和代理平台,使用 Anthropic 进行最困难的分析工作,并在其速度和较低成本可以改变经济效益的地方测试 Grok。

Grok 4.5 有着明确的角色。它是一个成本高效的前沿模型,而不是新的质量领导者。

什么是 Grok 4.5?

SpaceXAI 于 7 月 8 日发布了 Grok 4.5,作为其编码、代理任务和知识工作的旗舰。该公司与 Cursor 一起训练了它,并通过 xAI API、Grok Build 和 Cursor 提供。

该模型接受文本和图像,返回文本,并支持函数调用、结构化输出和可配置推理。其上下文窗口为 500,000 个令牌。已发布的知识截止日期为 2026 年 2 月 1 日,因此当前信息需要 xAI 的网页或 X 搜索工具。

Grok Build 是开源的,这为团队提供了一种检查代理循环、上下文组装、工具调度、钩子、技能、插件和 MCP 集成的方法。Grok 4.5 模型本身仍然是专有的;SpaceXAI 尚未发布其权重。

Grok 4.5 与 GPT-5.6 Sol 与 Claude Fable 5

广泛的比较更倾向于 Anthropic 和 OpenAI 的质量,然后是 Grok 的成本。这些值结合了独立的人工分析测试和每个提供商当前的 API 文档。

测量Grok 4.5GPT-5.6 SolClaude Fable 5
------:---:---:
人工分析智能指数545960
编码代理指数Grok Build 中的 76Codex 中的 80Claude Code 中的 77(后备)
每个智能指数任务的成本$0.31$1.04$2.75
上下文窗口500k 令牌1.05M 令牌1M 令牌
每百万令牌的 API 输入/输出$2 / $6$5 / $30$10 / $50
权重关闭关闭关闭
Grok 4.5、GPT-5.6 Sol、Claude Fable 5 和其他前沿模型在人工分析智能指数上的表现
Grok 4.5、GPT-5.6 Sol、Claude Fable 5 和其他前沿模型在人工分析智能指数上的表现

*来源:人工分析,2026 年 7 月 17 日。其 v4.1 指数结合了九个代理、编码、推理、知识和长上下文评估。*

五分将 Grok 与 Sol 分开,六分将其与 Fable 分开。这个差距足够大,能够在困难任务中显现出来,但又足够小,以至于成本、延迟和工具可靠性可以在高容量工作中逆转实际结果。

Grok 4.5 在哪里表现良好?

编码代理和终端工作

Grok 4.5 在人工分析编码代理指数中在 Grok Build 中得分 76。Sol 在 Codex 中以 80 分领先。Fable 5 在 Claude Code 中得分 77,尽管该配置可以回退到 Opus 4.8。

Grok 与测试的 Fable 配置之间相差一分。它与 Sol 之间相差四分。这足够接近,值得进行库级试验,特别是当一个代理运行数百个工具调用和输出令牌成本累积时。

Grok 4.5 在 Grok Build 中与 GPT-5.6 Sol 在 Codex 中和 Claude Fable 5 在 Claude Code 中的编码代理指数比较
Grok 4.5 在 Grok Build 中与 GPT-5.6 Sol 在 Codex 中和 Claude Fable 5 在 Claude Code 中的编码代理指数比较

*来源:人工分析。该指数平均了 DeepSWE、Terminal-Bench v2 和 SWE-Atlas-QnA。工具不同,因此图表测量模型-代理组合。*

SpaceXAI 的发布表讲述了一个类似但不那么当前的故事。Grok 在 SWE Marathon 中以 29.0% 领先,在 Terminal-Bench 2.1 中得分 83.3%,在 SWE-Bench Pro 中达到 64.7%。Fable 5 在所示的五个编码测试中领先四个。SpaceXAI 将 Grok 与 GPT-5.5 而不是 GPT-5.6 Sol 进行了比较,因此我不会将该供应商表用于直接的 Sol 评判。

速度和令牌效率

人工分析测量 Grok 4.5 的输出速度约为每秒 112 个输出令牌。SpaceXAI 报告每秒 80 个令牌,并表示该模型在解决的 SWE-Bench Pro 任务中使用了 15,954 个输出令牌,比 Claude Opus 4.8 的比较少 4.2 倍。

这些数字描述了不同的测试设置,但它们指向同一个方向:Grok 旨在以更少的输出完成代理工作。当编码代理读取文件、运行命令、修复故障并重复循环时,这种节省是重要的。

Grok 4.5 是成本赢家吗?

对于少于 200,000 个令牌的提示,xAI 收取每百万输入令牌 2 美元,缓存输入 0.50 美元,输出 6 美元。一旦提示超过 200,000 个令牌,费率将翻倍,分别为 4 美元、1 美元和 12 美元。

短上下文的标价比 Sol 的输入低 60%,输出低 80%。Fable 5 的输入成本是其五倍,输出成本是其八倍以上。

人工分析图表比较模型智能与基准任务的成本,包括 Grok 4.5、GPT-5.6 Sol 和 Claude Fable 5
人工分析图表比较模型智能与基准任务的成本,包括 Grok 4.5、GPT-5.6 Sol 和 Claude Fable 5

*来源:人工分析。每个任务的成本包括每个模型使用的令牌,而不是仅仅比较价格卡。*

独立任务成本比价格卡更有用:Grok 为 0.31 美元,Sol 为 1.04 美元,Fable 为 2.75 美元。Grok 在智能指数上落后于 Sol 五分,同时将该测试成本降低了约 70%。

生产成本仍然包括失败的工具调用、重复的补丁、审查时间和回归。一个便宜的运行需要高级开发人员修复结果,可能会比一个昂贵的干净运行成本更高。

Grok 4.5 在哪里落后?

整体质量和长上下文

Sol 和 Fable 在广泛的独立指数中领先。两者的上下文窗口大约是 Grok 的两倍。这个差异影响大型库、长研究包和无法在不丢失有用证据的情况下压缩历史的代理会话。

Grok 的发布基准强化了这一差距。Fable 在 SpaceXAI 自己的图表中领先 DeepSWE 1.0、DeepSWE 1.1、Terminal-Bench 2.1 和 SWE-Bench Pro。Grok 在 SWE Marathon 中获胜,该测试较长的软件工程任务,但一次胜利并不能确立一致的领导地位。

知识可靠性

Grok 4.5 将 AA-Omniscience 的准确性从 Grok 4.3 的 35% 提高到 52%。其幻觉率从 25% 上升到 54%。综合的 Omniscience 得分从 18 增加到 26,因为 Grok 正确回答了更多问题,但它也给出了更多不支持的答案,而不是拒绝。

Grok 4.5 知识准确性、幻觉率和 AA-Omniscience 得分与领先 AI 模型的比较
Grok 4.5 知识准确性、幻觉率和 AA-Omniscience 得分与领先 AI 模型的比较

*来源:人工分析的 Grok 4.5 评估。幻觉率属于 AA-Omniscience,不应推广到每种提示类型。*

我需要检索、引用证据和外部验证才能使用 Grok 进行事实出版。对 Sol 和 Fable 也适用相同的规则,但 Grok 的准确性与幻觉的变化值得进行专门测试。

什么阻碍了我当前技术栈中的 Grok 4.5?

我需要符合欧盟的访问权限来进行此部署。xAI 的 Grok 4.5 文档仍然表示 API 控制台访问对欧盟用户不可用,并预计在 7 月晚些时候提供。这可能很快会改变,但今天阻碍了稳定的生产路线。

xAI 默认将 API 输入和输出存储 30 天,并表示在没有明确许可的情况下不会对其进行训练。零数据保留适用于符合条件的团队,尽管启用它会移除有状态的 Responses API 功能、文件和集合以及批量 API 支持。任何生产试验在代码或客户材料到达服务之前都需要进行数据处理审查。

推薦閱讀

OpenAI 仍然是我的默认选择,因为 Sol 在当前编码代理指数中领先,具有 1.05 百万令牌的上下文窗口,并适合我已经使用的 Codex 和 Responses API 工作流。我的 GPT-5.6 Sol 和 Fable 5 比较 更详细地解释了这一路线。

Anthropic 仍然是我第二条路线,适用于长时间、模糊的分析,其中 Fable 的质量优势可以弥补其更高的价格。Grok 需要在完成任务成本上超越其中一条路线,而不仅仅是令牌价格。

推薦閱讀

我的标准来自于 构建真正有效的 AI 代理:衡量完成的工作、工具失败、审查时间和在错误操作后恢复。

我将如何测试 Grok 4.5

在 Grok Build、Codex 和 Claude Code 中运行相同的库问题。记录接受的更改、令牌、命令、失败的测试和审查分钟。
给每个模型一个包含冲突来源的长研究包。测量引用覆盖率、不支持的主张和反馈后的更正。
重复浏览器和电子表格工作流程十次。比较完成率、延迟和总 API 成本,而不是最佳单次运行。

我会在欧盟访问权限开放并且 Grok 通过这些测试后重新考虑路由。在那之前,Grok 4.5 是一个值得基准的候选者,而不是生产依赖。

实用模型选择

当高容量代理工作、快速输出和每个完成任务的成本主导决策时,选择 Grok 4.5——并且当其 500,000 令牌的上下文和区域可用性适合您的部署时。

当您想要当前最强的编码代理结果、成熟的工具表面和更大的上下文窗口时,选择 GPT-5.6 Sol

当任务在分析上足够困难,以至于可以证明最高的令牌价格,并且您重视其在广泛智能基准上的领先时,选择 Claude Fable 5

我的路线仍然是 OpenAI 加上 Anthropic,Grok 在测试中。Grok 4.5 使得这项测试在经济上变得有趣。已发布的结果尚未证明迁移的合理性。

来源和方法论

我检查了 SpaceXAI 的 Grok 4.5 公告模型文档实时定价表安全 FAQGrok Build 开源公告。独立结果来自于人工分析的 Grok 4.5 评估 及其 7 月 17 日的前沿比较。我使用了 OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Claude Fable 5 文档 进行竞争规格和价格的比较。

分数、价格、访问说明和产品行为截至 2026 年 7 月 18 日为最新。提供商可以在不更改文章的情况下更改服务行为、定价、区域访问和模型别名。