Gemini 3.6 Flash 与 GPT-5.6 Sol 是本周最重要的 AI 路由问题。谷歌在 2026 年 7 月 21 日 发布了 Gemini 3.6 Flash,而更大的故事并不是普通的发布炒作。真正的故事是谷歌正在推动一种更便宜的代理模型,具有更强的编码能力、更低的冗长性,以及比大多数前沿系统更容易的免费测试路径。
与此同时,OpenAI 已经将 GPT-5.6 转变为一个三层次的家族,而 Moonshot AI 正在利用 Kimi K3 对封闭模型市场施加真正的压力。截至 2026 年 7 月 26 日,我的看法很简单:如果你构建 AI 代理,真正的问题不是哪个模型在一个基准截图中获胜。真正的问题是 你首先路由哪个模型,何时升级,以及这个决定每个任务的成本是多少。
我并不把供应商基准图表视为福音。这是一个基于官方发布说明、定价、工具表面以及本周生态系统信号的路由决策。
快速裁决
如果你想要简短的版本:
如果我今天在构建或更新一个真实的代理堆栈,这就是我会使用的结论。
2026 年 7 月的 Gemini 3.6 Flash 与 GPT-5.6 Sol
在短时间内发生了三件事。
首先,谷歌表示 Gemini 3.6 Flash 在 3.5 Flash 的基础上进行了改进,同时将输出令牌使用量减少了 17%,并将价格降低到 每百万输入令牌 $1.50 和 每百万输出令牌 $7.50。这很重要,因为大多数代理成本并不是来自一个大答案。它们来自重复的循环、工具调用、重试和冗长的中间步骤。
其次,OpenAI 在 2026 年 7 月 9 日 发布的 GPT-5.6 使家族结构更加清晰。Sol 是旗舰,Terra 是平衡层,Luna 是最便宜的层。这对于真正的路由来说是一个比旧的“一个旗舰适用于所有”的故事更好的产品形状。
第三,Moonshot 表示 Kimi K3 是其在长远编码和深度推理方面的旗舰,具有 2.8T 参数、原生多模态性和 1M 令牌上下文窗口。官方的 Kimi 快速入门还表示 完整模型权重将在 2026 年 7 月 27 日之前发布。即使你不打算自托管,这也是一件大事,因为开放权重压力改变了整个市场的定价和买家行为。
实际比较
以下是比市场营销文案更重要的版本。
| 模型 | 官方定位 | API 价格 | 最佳首次使用 |
|---|---|---|---|
| --- | --- | --- | --- |
| Gemini 3.6 Flash | 用于编码、知识工作和多模态代理的高效工作马 | 每百万令牌 $1.50 输入 / $7.50 输出 | 成本敏感代理的默认首次路由 |
| GPT-5.6 Sol | OpenAI 用于编码、工具使用、知识工作和复杂工作流的旗舰 | 每百万令牌 $5 输入 / $30 输出 | 对于困难或昂贵任务的高信心升级 |
| Kimi K3 | Moonshot 用于长远编码和深度推理的旗舰 | Moonshot 将 K3 列为每百万令牌约 $3 输入 / $15 输出 | 长上下文实验、开放权重策略和价格压力 |
该表格就是为什么 Gemini 3.6 Flash 比最初看起来更有趣。它并不是试图在每个任务中击败最昂贵的模型。它试图赢得 首次路由决策。
对于代理构建者来说,这通常是堆栈中最有价值的插槽。
为什么 Gemini 3.6 Flash 是潜在的黑马
谷歌的官方宣传不仅仅是 3.6 Flash 比 3.5 Flash 更好。更强的观点是它 在更便宜的同时更高效。
这种组合很重要,因为代理系统以无聊的方式失败:
谷歌明确将 3.6 Flash 定位为在编码、知识工作、多模态任务和计算机使用方面更强。该公司还表示,相对于 3.5 Flash,它在 DeepSWE、MLE Bench、OSWorld-Verified 和 GDPval-AA v2 上有所改进。
即使你稍微打折供应商数字,产品方向也是明确的:谷歌正在试图使 Flash 成为 严肃的代理默认选项,而不是便宜的后备。
我认为这比基准剧院更重要。
Gemini 3.6 Flash 重要的第二个原因是 测试路径。官方的 `google-gemini/gemini-cli` 存储库表示 Gemini CLI 是开源的,支持 MCP、文件操作、Shell 命令和网络抓取,并提供每分钟 60 次请求 和每天 1,000 次请求 的免费层,使用个人谷歌账户。这是一个真实的工作流表面,而不仅仅是一个演示配额。
如果你在决定首先尝试什么而不想太快打开钱包,Gemini 现在在这个比较中拥有最干净的低摩擦路径。
GPT-5.6 Sol 仍然胜出的地方
OpenAI 仍然拥有最强的“我需要这个来处理困难任务”的位置。
官方的 GPT-5.6 发布将 Sol 描述为编码、知识工作、网络安全和科学的旗舰,OpenAI 表示它在每美元的性能上有所提高,同时使用的令牌比以前的模型更少。对我来说,最重要的部分不是头条分数,而是对 工具使用、长期工作流、计算机使用和多代理执行 的反复强调。
这正是高端模型保持优势的地方。
如果任务的错误代价很高,我仍然宁愿为 Sol 付费,而不是省一点钱然后在清理上花费。包括像:
OpenAI 现在也更清楚地说明了其家族内部的分层路由。7 月 9 日的发布将 Terra 和 Luna 定位为低成本选项,OpenAI 表示 Free 和 Go 用户可以在 ChatGPT Work 和 Codex 中访问 GPT-5.6 Terra。这使得 OpenAI 堆栈比纯粹的 Sol 读取所暗示的更灵活。
不过,核心裁决并没有改变。 GPT-5.6 Sol 是升级模型,而不是便宜的默认选项。
为什么 Kimi K3 重要,即使你今天不切换
Kimi K3 重要有两个原因。
第一个是显而易见的:Moonshot 将其定位为 长远编码、深度推理 和 1M 令牌上下文 的前沿模型。如果完整权重真的在 2026 年 7 月 27 日 发布,这将不断增加对封闭提供商的压力,以证明高价的合理性。
第二个原因更实际。Kimi 不仅在推动模型层。它还在推动工作流层。
官方的 Kimi Code 存储库和文档展示了一个终端代理,可以读取和编辑代码、运行 Shell 命令、抓取网络,并根据反馈调整其下一步。这很重要,因为市场正在从“哪个模型最聪明?”转向“哪个模型加工具表面最容易操作?”
我仍然不会将 Kimi K3 作为我对每个人的默认推荐。原因很简单:最安全的生产选择不仅仅是基准雄心。它还与稳定性、文档深度以及周围生态系统对英语全球开发者受众的可预测性感觉有关。
但现在忽视 Kimi K3 将是一个错误。它已经在改变谈判。
便宜或免费的测试问题
这就是许多比较帖子变得无用的地方。
人们不仅想知道哪个模型是“最佳”。他们想知道今天可以测试什么,而不需要过早投入太多资金。
这是我在 2026 年 7 月 26 日 的思考方式:
这也是我认为本周主要不是关于基准的原因。它是关于 访问路径。
具有最佳纸面分数的模型并不总是赢得工作流。
我对开发者的路由推荐
在我自己的操作逻辑中,我首先路由的模型并不是我最信任的处理最困难工作的模型。
如果我今天在更新代理堆栈,我会这样路由:
这并不意味着 Gemini 在某种绝对意义上“优于 OpenAI”。
这意味着 默认通道 和 升级通道 不再是同一条通道。
这是这里最重要的变化。
如果你的预算是真实的,Gemini 3.6 Flash 现在更难以忽视。
如果你的风险是真实的,GPT-5.6 Sol 仍然更容易证明。
如果你的策略依赖于选择性和开放市场保持激进,Kimi K3 值得认真关注。
相关阅读
如果你想了解这个周期的另一面,请阅读 Kimi K3 vs GPT-5.6 Sol 和 Claude Fable 5:基准裁决→、Qwen Code vs Kimi Code:免费的 AI 编码代理浪潮来了→ 和 21.54 亿令牌后的代码代理:缺少什么?→。
最终裁决
我的裁决并不复杂。
Gemini 3.6 Flash 是本周最有趣的新路由模型。
不是因为它突然推翻了每个旗舰。也不是因为谷歌赢得了每个图表。它的重要性在于它结合了更低的价格、更强的代理定位,以及该组中最容易的真实测试表面。
这足以改变我首先尝试的内容。
GPT-5.6 Sol 仍然是我在质量、持久性和高风险执行最重要时愿意付费的模型。
Kimi K3 是我会关注的模型,如果我关心长上下文、开放权重杠杆以及价格压力的下一步方向。
这就是我现在会认真对待的路由堆栈。
常见问题
Gemini 3.6 Flash 比 GPT-5.6 Sol 更好吗?
在我用于高风险工作的绝对意义上并不是。GPT-5.6 Sol 仍然看起来是更强的高端升级模型。Gemini 3.6 Flash 在许多代理工作流中作为低成本首次模型看起来更好。
为什么要将 Gemini 3.6 Flash 与 Kimi K3 进行比较?
因为 Kimi K3 在战略上很重要,即使产品表面不同。它的 1M 令牌上下文、旗舰定位和承诺的开放权重发布改变了买家对价格和选择性的看法。
这里最容易免费测试的模型是什么?
Gemini 今天拥有最干净的公共工作流,因为 Gemini CLI 是开源的,谷歌表示个人账户每分钟可以请求 60 次,每天可以请求 1,000 次。
