GPT-5.5 技能规划实践
GPT-5.5 技能更有用,因为模型在行动前更擅长规划。这是实际的升级。该模型不仅在回答问题时更强大;它在选择正确的指令、使用正确的工具、检查结果以及在实际工作中处理复杂情况方面也更出色。
OpenAI 的 GPT-5.5 发布不仅仅是一个基准故事。更重要的变化是,该模型在使用周围的工具方面更为出色:技能、工具、文件、终端、浏览器、文档和反馈循环。对于使用 Codex 或代理工作流程的人来说,GPT-5.5 技能比原始答案质量的另一个小提升更为重要。

当模型知道何时加载技能、应遵循多少以及何时停止阅读并开始行动时,技能才有用。以前的模型可以使用技能,但通常需要更严格的监督。GPT-5.5 感觉不同,因为它更擅长将模糊的目标转化为一个序列:检查代码库、选择相关的规则集、规划更改、运行正确的工具、验证结果并保持工作范围。
这就是能够回答工作流程问题的模型与能够实际在其中工作的模型之间的区别。
为什么规划会改变结果
我注意到的最强改善是规划的纪律性。GPT-5.5 技能更有效,因为模型更有可能在编辑、搜索或运行命令之前形成一个有用的短期计划。这听起来简单,但它改变了长期任务的质量。
良好的规划有三个作用。
首先,它减少了解释损失。如果用户说:“通过个人网站 MCP 创建一个帖子”,模型需要理解工具边界、代码库规则、发布风险、现有内容系统以及草稿创建与实时发布之间的区别。
其次,它防止了过早编辑。更好的模型会读取本地规则,检查当前状态,找到现有内容,然后选择最小的有用操作。
第三,它改善了恢复。实际工作很少是完美的。工具可能返回模型未预期的形状。路线可能已经改变。代码库可能已经包含未提交的更改。GPT-5.5 更擅长在不丢失上下文的情况下进行适应。
OpenAI 在其 GPT-5.5 系统卡 中描述 GPT-5.5 是为复杂的现实工作而设计的,涵盖编码、研究、文档、电子表格和工具使用。重要的短语不仅仅是更聪明。模型需要更少的指导,更有效地使用工具,检查工作并继续进行。这正是 GPT-5.5 技能变得有价值的地方。
技能不是提示。它们是操作程序。
一个弱模型将技能视为一个长提示。它阅读过多,遵循无关的细节,有时因为关键字匹配而应用错误的工作流程。
一个更强的模型将技能视为操作程序。它会问:这个技能是否真的相关,哪些部分重要,哪些约束会覆盖我的默认行为,以及在我声称完成之前我应该验证什么?
这种区别对 Codex 很重要。许多有用的技能并不是关于生成代码。它们是关于如何在项目中行为:
GPT-5.5 技能更适合这种工作风格,因为模型可以同时记住任务、工具状态和项目规则。输出不那么随机。工作流程更连贯。
技能质量标准提高
更好的技能使用并不意味着每个指令文件都是自动良好的。实际上,GPT-5.5 更容易发现弱技能。
如果一个技能模糊,模型可能会更一致地遵循模糊行为。如果一个技能将部署规则、UI 偏好和无关示例混合成一个长块,模型必须花费更多精力来分离信号与噪声。GPT-5.5 技能在每个技能都有明确触发器、狭窄范围和具体完成定义时效果最佳。
最好的技能像判断的检查表,而不是服从的脚本。它们应该告诉模型什么重要,应该避免哪些风险,以及什么验证证明任务已处理。
更好的工具使用使代理工作流程不那么脆弱
OpenAI 的发布帖子表示,GPT-5.5 在编码、在线研究、数据分析、创建文档和电子表格、操作软件以及在任务完成之前跨工具移动方面更强大。它还强调了在 GPT-5.5 公告 中 Codex 和计算机使用工作流程的提升。
这直接映射到代理工作。困难的部分很少是一个孤立的答案。困难的部分是协调:
这就是 GPT-5.5 技能感觉比早期模型更有用的地方。模型更擅长在工具调用之间保持方向感。它可以注意到辅助工具有错误,绕过它,并仍然正确使用底层系统。
例如,如果搜索工具失败,因为 API 返回了帖子有效载荷而不是原始数组,模型不应该停止。它应该使用列表工具,在本地过滤并继续。这就是更好规划的实际价值:减少了对监督的需求。
工具使用是规划变得可见的地方
规划听起来可能很抽象,直到工具进入循环。一个规划不好的模型以错误的顺序调用工具,在错误后失去上下文,或者将每个失败视为阻碍。一个规划良好的模型保持任务的工作地图。
GPT-5.5 技能在描述该地图时最有帮助:首先检查,其次更改,第三验证,仅在获得批准后发布。这个顺序很重要。这是快速演示和可以在真实代码库中信任的工作流程之间的区别。
Codex 连接
我已经单独写过关于 OpenAI GPT-5.5 编码模型测试→ 的文章。编码角度很重要,但技能扩展了这个故事。
在 Codex 中,模型不仅仅是在编写代码。它在阅读指令、协调工具、尊重本地约定、处理 Git 状态以及决定何时任务完成。GPT-5.5 的优势在于这些部分需要在一个循环中发生时。
一个编写良好补丁但忽略项目规则的编码模型仍然是有风险的。一个能够规划、使用技能、运行测试并解释更改的模型更接近于可靠的合作者。
OpenAI 还表示,GPT-5.5 在测试长期命令行工作流程、现实问题解决和计算机环境操作的基准测试中表现强劲。基准测试并不是全部,但它们指向同一个方向:模型在持续执行方面的改进,而不仅仅是静态答案。
对于更广泛的网络,这是我在 您的网站是否准备好代理?2026 年检查清单→ 中涵盖的同一趋势。网站、API 和内容系统越来越需要为代理提供干净的接口,而不仅仅是为人类提供。
MCP 使模式具体化
MCP 是一个很好的例子,因为它将意图转化为类型化的工具调用。个人网站服务器可以暴露诸如创建帖子、更新帖子、分析 SEO 或发布帖子的操作。GPT-5.5 技能帮助模型决定哪个操作是合适的,以及何时更安全的草稿路径比实时发布更好。
这就是为什么我仍然喜欢构建小型 MCP 服务器,如我在 TypeScript MCP 服务器指南→ 中所述。服务器为模型提供了能力。技能告诉它如何负责任地使用这些能力。GPT-5.5 更擅长将这两层结合起来。
这对构建 AI 代理的人意味着什么
对于构建者来说,教训很明确:在技能上投入更多。
当模型在程序执行方面较弱时,将所有内容放入一个巨大的系统提示中是很诱人的。这使得提示变得脆弱。GPT-5.5 使更模块化的方法更具吸引力:
模型现在可以从这种结构中受益更多。它更擅长在正确的时间选择正确的指令,然后通过多个步骤执行。
这也意味着糟糕的技能变得更加明显。如果一个技能模糊、过于宽泛或充满过时的行为,GPT-5.5 可能会比你想要的更一致地遵循它。更好的模型提高了干净指令的价值和草率指令的成本。
有用的 GPT-5.5 技能检查表
如果您正在为 GPT-5.5 准备技能,我会从这个检查表开始:
这个检查表很重要,因为 GPT-5.5 技能现在可以指导实际执行。程序越好,代理的行为就越好。
规划层是产品
标题不应该是“GPT-5.5 更聪明”。更有用的标题是:GPT-5.5 使规划层感觉像是产品的一部分。
当模型能够良好规划时,技能变得可组合。工具变得更安全。代码库变得更容易导航。多步骤工作变得不那么依赖于用户手动引导每一步。
这就是我关心的转变。GPT-5.5 不仅在生成文本方面更好。它在真实工作环境中操作方面更好。
对于 Codex 用户来说,这意味着技能不再仅仅是漂亮的文档。它们正在成为人类意图与代理执行之间的实际接口。
实际收获
如果您在使用 GPT-5.5 与 Codex 或其他代理环境,最佳的下一步不是编写更长的提示。而是改善围绕工作的技能和规则。
使它们具体。保持它们的时效性。定义它们何时适用。包括验证。将草稿创建与发布分开。明确风险行为。
GPT-5.5 技能可以比早期模型更好地使用这种结构。结果不是魔法,但这是朝着能够规划、使用工具并在更少监督下完成实际任务的代理迈出的重要一步。