GPT-5.6 Sol 已正式发布:相比 Claude Fable 5 有哪些变化
Tech
OpenAI
GPT-5.6
GPT-5.6 Sol
GPT-5.6 Sol Ultra

GPT-5.6 Sol 已正式发布:相比 Claude Fable 5 有哪些变化

OpenAI GPT-5.6 Sol 已正式发布。本文介绍了有哪些变化、Sol Ultra 代表什么、目前有哪些基准测试,以及它与 Claude Fable 5 的比较。

Uygar DuzgunUUygar Duzgun
Jun 26, 2026
更新於 2026年8月22日
7 min read

GPT-5.6 已不再是传闻。OpenAI 于 2026 年 6 月 26 日发布了 GPT-5.6 Preview System Card,其中最重要的细节在于此次发布的形式:一个模型家族、有限的预览控制,以及对智能体安全的大量关注。

推薦閱讀

两周前,我写过一篇早期 GPT-5.6 传闻核查。那篇文章在当时是正确的:GPT-5.6 尚未公开。今天,情况发生了变化。

我的看法很简单。GPT-5.6 是 OpenAI 对 Anthropic 借助 Claude Fable 5 带来的同一压力的回应:人们正在根据模型能否运行真实工作、能否安全使用工具,以及任务变得漫长而混乱时能否保持可靠,来评判这些模型。

OpenAI 宣布了什么

OpenAI 将 GPT-5.6 描述为一个包含三个模型的新家族:SolTerraLuna。Sol 是旗舰模型,Terra 是成本更低但能力出色的选项,而 Luna 是该家族中速度最快、成本效益最高的成员。

OpenAI 并没有把这次发布当作普通的聊天模型升级。公司强调了复杂推理、编码、计算机使用、工具使用、事实准确性,以及更安全的智能体行为。这是一组值得关注的主张,因为这些正是前沿模型要么成为有用的执行者、要么沦为昂贵的自动补全工具的关键领域。

该系统卡也提供了一些有用的信号。OpenAI 表示,与 GPT-5.5 相比,GPT-5.6 在 LongFact 上减少了重大事实错误,并且在一项生产流量分析中降低了幻觉率。它还用了大量篇幅讨论提示注入、意外的数据破坏性操作、计算机使用过程中的用户确认、对齐,以及网络安全和生物/化学风险等准备度类别。

这让我认为,OpenAI 希望 GPT-5.6 被当作一个智能体平台来评判,而不仅仅是一个更聪明的答案框。

Sol Ultra 与基准测试信号

Sol Ultra 也值得关注,但我会谨慎措辞。OpenAI 描述了 Sol 的新 `max` 推理强度,以及一种使用子智能体来加速复杂工作的全新 `ultra` 模式。我的理解是,这是更高计算量的 Sol 模式,而不是第四个基础模型。系统卡中的基础模型家族仍然是 Sol、Terra 和 Luna。

OpenAI 表示,待这些模型正式普及后,将分享更广泛的评估集。目前,以下是值得展示的基准测试信号:

基准测试或评估已发布的 GPT-5.6 信号
------
Terminal-Bench 2.1OpenAI 表示,GPT-5.6 Sol 在需要规划、迭代和工具协调的命令行工作流上创下了新的最佳成绩。
GeneBench v1OpenAI 表示,Sol 在长周期基因组学和定量生物学工作流上击败了 GPT-5.5,同时使用更少的 token。
ExploitBenchOpenAI 表示,Sol 的表现可与 Mythos Preview 竞争,同时输出 token 约为其三分之一。
ExploitGymOpenAI 表示,随着推理强度增加,Sol、Terra 和 Luna 的表现都会提升。
内部 CTF 任务系统卡称,GPT-5.6 Sol 在该评估中达到 96.7%,基本饱和。
Irregular FrontierCyberGPT-5.6 Sol 解决了 197 个挑战中的 19 个;报告的成功率分别为 Easy 11%、Medium 12%、Hard 5% 和 Elite 0%。
CyScenarioBench 和 Atomic ChallengesIrregular 报告称,Sol 在 CyScenarioBench 上取得 28%。在 Atomic Challenges 上,Sol 在 Network Attack Simulation 中得分 98%,在 Vulnerability Research and Exploitation 中得分 91%,在 Evasion 中得分 56%。

这些信息很有用,但还不是最终的胜利宣言。大多数具体的公开数据都集中在网络安全领域。关于通用编码和智能体能力的说法很强,但在断言 Sol Ultra 在普通软件工作中全面优于 Claude Fable 5 之前,我们仍需要更广泛的第三方测试。

与 Claude Fable 5 相似的地方

Claude Fable 5 以不同的风格推动了同一前沿。Anthropic 于 6 月 9 日发布了它,并将其作为 Mythos 级模型提供给普通用户使用。Anthropic 将 Fable 5 定位于漫长而复杂的任务:软件工程、知识工作、视觉、科学研究,以及长周期智能体工作。

两者的重叠之处很明显。

领域GPT-5.6 SolClaude Fable 5
---------
主要卖点旗舰级智能体与推理模型Mythos 级通用前沿模型
最强使用场景编码、工具使用、计算机使用、事实准确性、智能体软件工程、长任务、知识工作、视觉
安全定位预览系统卡、准备度类别、提示注入与对齐工作Fable 安全措施、Mythos 划分、敏感领域的备用路由
买家关心的问题我能否信任它在工具中执行操作?我能否获得访问权限,并在将其作为依赖项时保持稳定?

两家公司正在趋向同一个产品事实:模型必须在系统内部工作。它必须遵循指令、处理工具、避免破坏性操作,并为团队提供足够的证据来信任结果。

推薦閱讀

这正是我在意的编码智能体部分。我不需要另一个能写出自信措辞的模型。我需要一个能检查代码仓库、理解约束、运行检查,并在触碰无关工作之前停下来的模型。我在AI agent goal and loop workflow中进一步介绍了这种工作方式。

GPT-5.6 与 Fable 5 的差异

第一个差异是访问方式。

OpenAI 将以预览控制的形式启动 GPT-5.6。这种做法较为保守,但很明确。Anthropic 则更广泛地发布了 Fable 5,随后在 6 月 12 日发表声明称,在美国政府发布出口管制指令后,不得不暂停 Fable 5 和 Mythos 5 的访问。Anthropic 表示,其他 Claude 模型的访问不受影响,但 Fable 5 一夜之间变成了一个难以依赖的生产依赖项。

这改变了比较方式。一个模型即使非常出色,如果访问权限可能在没有正常迁移窗口的情况下发生变化,它仍然可能难以成为构建基础。

第二个差异是产品重点。

Anthropic 对 Fable 5 的叙事以能力为先:更强的长周期工作能力、超大上下文,以及面向普通使用的 Fable 5 和面向可信网络防御访问的 Mythos 5 之间的划分。OpenAI 对 GPT-5.6 的叙事则更偏向部署:模型家族、预览控制、安全系统卡、提示注入工作,以及对智能体失败模式的明确关注。

第三个差异是语气。

Anthropic 让 Fable 5 感觉像是对上一代 Claude 产品线的一次跃升。OpenAI 则将 GPT-5.6 定位为一个更安全、更可靠的困难工作运行层。这听起来可能没那么戏剧化,但生产环境中的 AI 智能体恰恰会在这些地方出问题:工具权限、上下文控制、事实准确性、隐藏的副作用,以及模型是否会承认不确定性。

我对 GPT-5.6 的实际测试标准

我不会仅凭发布图表来评判 GPT-5.6 Sol。我想进行的第一项测试是一项真实的工程任务:

一个脏的 git 工作树
过时的文档
失败的测试
一个涉及多个文件的 bug
一个 MCP 工具界面
一个需要克制的部署或发布步骤
推薦閱讀

一个优秀的模型应该先阅读再编辑,做出最小且安全的修改,验证结果,并在遇到阻碍时进行报告,而不是假装一切都已完成。GPT-5.5 已经在 Codex 中改善了这种模式,我在GPT-5.5 Codex 测试中介绍过这一点。GPT-5.6 必须在那些乏味的部分做得更好:更少的错误假设、更干净的工具调用,以及更可靠的停止条件。

推薦閱讀

Fable 5 仍然重要,因为它为漫长而复杂的工作设定了标准。我的Claude Fable 5 发布日评测之所以给出积极评价,正是因为这一点。访问问题并不会抹去它的能力表现,但它带来了一个采购层面的教训:如今选择前沿 AI 时,除了基准测试风险,还必须考虑政策风险。

结论

GPT-5.6 Sol 看起来像是 OpenAI 对 Fable 5 时刻的认真回应。两者的目标相似:长任务、编码、智能体,以及更安全的高能力使用。它们的发布策略不同。Anthropic 展示了能力跃升可能是什么样子。OpenAI 则试图让下一次跃升看起来能够部署。

Sol Ultra 让这次发布更有趣,因为它指向的是多智能体执行,而不仅仅是更深入的单模型推理。但我仍然会根据它完成的工作来评判:代码仓库检查、工具使用、从错误中恢复,以及它是否能为负责该系统的人留下清晰的操作轨迹。

对于构建者来说,赢家不是发布声量最大的模型。赢家是能够完成真实工作、安全使用工具,并留下清晰审计轨迹的模型。

这就是我首先要测试的内容。

2026 年 6 月 26 日核查的来源

OpenAI 发布文章:Previewing GPT-5.6 Sol,于 2026 年 6 月 26 日在浏览器中核查