Kimi K3 与 GPT-5.6 Sol 和 Claude Fable 5:基准评测结果
Tech
Kimi K3
Moonshot AI
GPT-5.6 Sol
Claude Fable 5

Kimi K3 与 GPT-5.6 Sol 和 Claude Fable 5:基准评测结果

Kimi K3 达到前沿并赢得关键编码测试。我的基于基准的评测结果:测试它,但在生产中继续使用 OpenAI 和 Anthropic。

Uygar DuzgunUUygar Duzgun
Jul 18, 2026
更新於 2026年7月23日
9 min read

Kimi K3 与 GPT-5.6 Sol 的比较足够接近,以至于让我重新进行路由测试。Moonshot 的模型仍然无法替代我技术栈中的 OpenAI 或 Anthropic。

这个结论没有发布头条那么戏剧化,但数据支持这一点。Moonshot AI 的新旗舰在独立智能指数中排名第三,在盲前端编码领域领先,并在一项长期知识工作测试中击败了 GPT-5.6 Sol。它在最广泛的衡量标准上仍然落后于 Claude Fable 5 和 Sol,并且其可下载的权重仍然承诺在未来的某个日期发布。

截至 2026 年 7 月 18 日,我认为 Kimi K3 是一个严肃的评估候选者,而不是迁移生产工作的理由。我尚未将 K3 通过我自己的生产基准测试,因此我在下面将第三方结果与我的路由决策分开。

简短评测

最佳总体得分: Claude Fable 5 在人工分析智能指数中以 60 分领先。GPT-5.6 Sol 得分 59,Kimi K3 得分 57。
最佳盲前端结果: Kimi K3 在 Arena 的前端代码排名中以 1,679 Elo 领先,Fable 5 为 1,631,Sol 为 1,618。
最佳 API 价格: K3 每百万输入标记收费 3 美元,每百万输出标记收费 15 美元。Sol 收费 5 美元/30 美元,而 Fable 5 收费 10 美元/50 美元。
我的选择: 我将继续将 OpenAI 作为我的主要编码和代理平台,Anthropic 用于最困难的长期分析。在给 K3 生产流量之前,我将测试其在前端、自动化和研究工作负载上的表现。

结果是一个三模型竞赛,不同任务有不同的赢家。单一的排行榜无法告诉你哪个模型能以最少的重试完成你的工作。

Kimi K3 是什么?

Moonshot AI 于 7 月 16 日推出 Kimi K3,这是一个拥有 2.8 万亿参数的专家混合模型。它的路由器为每个标记选择 896 个专家中的 16 个。K3 还具有原生图像输入、百万标记的上下文窗口和文本输出。

Moonshot 将 K2 到 K3 的飞跃归因于两个架构变化:Kimi Delta Attention 和 Attention Residuals。该公司报告称其扩展效率比 K2 提高了大约 2.5 倍,但尚未发布技术报告。这个数字仍然是供应商的声明。

API 现在已经上线。Moonshot 表示完整的权重将在 7 月 27 日到达。在这些文件到达之前,K3 是一个 已宣布的开放权重模型,而不是一个你可以立即下载并在自己的基础设施上验证的模型。

Kimi K3 vs GPT-5.6 Sol vs Claude Fable 5

最干净的比较结合了独立测试和官方产品规格。下面的前四行来自人工分析和 Arena;上下文和定价来自每个提供商的文档。

测量Kimi K3GPT-5.6 SolClaude Fable 5
------:---:---:
人工分析智能指数575960
GDPval-AA v21,668 Elo1,748 Elo1,760 Elo
AA-Briefcase 知识工作1,547 Elo1,495 Elo1,583 Elo
前端代码 Arena1,679 Elo1,618 Elo1,631 Elo
上下文窗口1M 标记1.05M 标记1M 标记
每百万标记的 API 输入/输出$3 / $15$5 / $30$10 / $50
权重承诺 7 月 27 日关闭关闭
人工分析智能指数比较 Kimi K3、Claude Fable 5、GPT-5.6 Sol 和其他模型
人工分析智能指数比较 Kimi K3、Claude Fable 5、GPT-5.6 Sol 和其他模型

*来源:人工分析,2026 年 7 月 17 日。其 v4.1 指数结合了九个编码、推理、知识和代理评估。*

K3 和 Sol 之间的两分差距足够小,以至于比起质量、延迟、标记使用和故障恢复的重要性更低。与 Fable 5 的三分差距仍然是真实的。K3 已经达到了前沿组,但尚未赢得该组。

Kimi K3 的胜利之处?

前端编码和视觉迭代

K3 最强的独立结果是前端代码 Arena。人类评估者比较匿名的可运行前端输出,并投票选择更好的结果。K3 达到了 1,679 Elo,比 Fable 5 高出 48 分,比 Sol 高出 61 分。Arena 还在七个前端类别中将其排在第一。

这个结果对构建着陆页、仪表板、设计重建和视觉工具的团队非常重要。它衡量的是工作输出的偏好,而不仅仅是单元测试是否通过。

Moonshot 的更广泛编码表则是混合的。K3 在 Program Bench 中以 77.8 领先,在 SWE Marathon 中以 42.0 领先。Sol 在 DeepSWE 中以 73.0 领先,在 Terminal-Bench 2.1 中以 88.8 领先。Fable 5 在 FrontierSWE 中以 86.6 领先,并在 Moonshot 的内部 Kimi Code Bench 比较中以 76.9 领先。

Moonshot AI 编码基准比较 Kimi K3、GPT-5.6 Sol、Claude Fable 5 和其他模型
Moonshot AI 编码基准比较 Kimi K3、GPT-5.6 Sol、Claude Fable 5 和其他模型

*来源:Moonshot AI 的 Kimi K3 发布帖子。这些是供应商汇编的结果,模型有时使用不同的代理工具。*

工具选择会改变得分。K3 通常在 Kimi Code 中运行,Sol 在 Codex 中运行,Fable 在 Claude Code 中运行。基准可以测量模型、工具或两者之间的交互。我会在我计划部署的工具中重新运行一个代表性的代码库任务。

自动化和知识工作

人工分析给 K3 评分 53%,并在 AutomationBench-AA 中排名第一。在 AA-Briefcase,这是一项私人的长期知识工作评估,K3 得分 1,547 Elo。这超过了 Sol 的 1,495,但落后于 Fable 5 的 1,583。

Moonshot 的评估还在 BrowseComp 和 SpreadsheetBench 2 中略微领先 K3。Fable 在 GDPval-AA、JobBench 和广泛的 AA-Briefcase 得分中领先。Sol 在 AA-Briefcase 分析质量中仍然最强。

Moonshot AI 代理和视觉基准比较 Kimi K3、GPT-5.6 Sol 和 Claude Fable 5
Moonshot AI 代理和视觉基准比较 Kimi K3、GPT-5.6 Sol 和 Claude Fable 5

*来源:Moonshot AI。该图表包括独立得分、公共排行榜和 Moonshot 运行的测试;在将条形图视为一个受控实验之前,请阅读其脚注。*

K3 看起来对研究代理、电子表格工作和浏览器自动化很有用。当分析质量比价格更重要时,Fable 仍然是更安全的选择。Sol 适合已经使用 Codex、Responses API、托管工具和程序化工具调用的团队。

Kimi K3 仍然落后的地方?

广泛推理和专家知识

Fable 5 在 Humanity's Last Exam 中保持明显领先。Moonshot 报告 Fable 得分 53.3,Sol 得分 44.5,K3 得分 43.5(不使用工具)。使用工具时,得分上升到 63、58 和 56。这是一个比整体指数所暗示的更大的差距。

Sol 在 OpenAI 的发布表中发布了多个科学、计算机使用和长期上下文测试的最强得分。Fable 在 GDPval-AA 和 AA-Briefcase 中整体领先。K3 赢得了选定任务,但在各类别中并未表现出相同的一致性。

知识可靠性

K3 将其 AA-Omniscience 准确性从 33% 提高到 46%,与 K2.6 相比。它的幻觉率也从 39% 上升到 51%。综合的 Omniscience 得分从 6 提高到 18,因为 K3 正确回答了更多问题,但在不支持的答案中的回归值得在引用密集的工作中进行测试。

人工分析 Kimi K3 和领先 AI 模型的知识准确性和幻觉测试
人工分析 Kimi K3 和领先 AI 模型的知识准确性和幻觉测试

*来源:人工分析。幻觉率属于 AA-Omniscience,不应推广到每种提示类型。*

在使用这些模型进行事实发布之前,我需要源检索、引用证据和确定性验证。K3 的结果并没有改变这一规则。

Kimi K3 在实践中更便宜吗?

列表价格使 K3 看起来具有决定性:

Kimi K3:每百万标记 3 美元输入,15 美元输出,0.30 美元缓存输入。
GPT-5.6 Sol:每百万标记 5 美元输入,30 美元输出,0.50 美元缓存输入。
Claude Fable 5:每百万标记 10 美元输入,50 美元输出,享受 90% 的提示缓存折扣。

人工分析估计 Kimi K3 每个智能指数任务 0.94 美元,Sol 1.04 美元,Fable 5 2.75 美元。K3 的标记使用将其在该工作负载上的列表价格优势缩小到十美分。Fable 的成本更高,但它在整体指数和最困难的知识工作测试中也名列前茅。

每个标记的价格是一个不完整的预算。生产成本包括重试、工具调用、审查时间、延迟和从错误答案中恢复所需的工作。一个收费一半且需要两倍修复循环的模型并没有节省成本。

为什么我的技术栈仍然是 OpenAI 和 Anthropic

我已经使用 OpenAI 和 Anthropic 进行编码、研究和代理工作流。K3 尚未给我足够的证据来吸收第三个生产提供商。

推薦閱讀

OpenAI 仍然是我代理编码的默认选择,因为 Sol 在独立的编码代理指数中以 80 分领先,集成了 Codex 和 Responses API,并且为我的工作提供了最广泛的工具支持。我的 GPT-5.6 Sol 和 Fable 5 比较 更详细地涵盖了这一路由决策。

Anthropic 仍然是我进行长期、困难分析和复杂代码库工作的第二条路线。Fable 5 在整体智能指数、GDPval-AA、AA-Briefcase 和 Humanity's Last Exam 中领先。其 10 美元/50 美元的价格和 30 天的数据保留要求意味着我将把它保留用于质量提升覆盖这些限制的工作。

推薦閱讀

我的标准来自于构建真正有效的 AI 代理:完成的任务、观察到的工具故障和审查成本比头条得分更重要。

K3 进入了一个测试阶段,进行三项工作:

从参考图像重建一个真实的前端,并在一次和三次迭代后比较视觉缺陷。
在 Kimi Code、Codex 和 Claude Code 中运行相同的代码库任务,然后计算接受的更改、标记、工具故障和审查时间。
给每个模型相同的研究简报,并在反馈后评分不支持的声明、引用覆盖和更正。

在 Moonshot 发布权重和技术报告、我审查最终许可证以及 K3 经受住这些测试后,我将重新考虑生产路由。对于重前端或自动化工作负载的团队,可能会更早达到这一点。

实用模型选择

选择 Kimi K3 进行受控评估,当前端质量、浏览器自动化或较低的 API 列表价格主导工作负载时。

选择 GPT-5.6 Sol 当你需要一个成熟的编码代理环境、广泛的工具支持、强大的展示质量和在技术任务中的一致结果时。

选择 Claude Fable 5 当工作长、模糊且分析难度足以证明更高的成本和数据保留限制时。

我今天的答案是 OpenAI 加上 Anthropic,K3 正在测试中。Moonshot 值得这个测试,但尚未获得自动迁移的资格。

来源和方法论

我检查了 Moonshot 的 Kimi K3 发布帖子API 定价,人工分析的 独立 K3 评估,Arena 的盲前端排名由 AP 报道,OpenAI 的 GPT-5.6 发布Sol 模型文档,以及 Anthropic 的 Fable 5 发布Claude Fable 5 API 指南

所有得分和价格截至 2026 年 7 月 18 日。模型提供商可以在不更改模型名称的情况下更改定价、路由、安全措施和服务行为。