Kimi K3 跑分全解析:六个第一、一个致命短板、价格翻四倍(2026年7月)
Kimi K3 基准测试成绩汇总:前端 Arena 第一、SWE Marathon 第一、BrowseComp 第一,但 HLE 推理大幅落后 Fable 5。附人民币定价、DeepSeek V4 Pro 对比、选模型决策表。
¥100 一百万 token 的输出价格,值不值?
这是 Kimi K3 发布 24 小时以来,我在掘金评论区、V2EX 节点和几个开发者群里看到的频率最高的问题。不是"K3 强不强"——大家都看到了前端 Arena 第一、SWE Marathon 第一的截图。也不是"能不能用"——kimi.com 免费就能试。争议的核心就是一个字:贵。
K2.6 时代,月之暗面靠 ¥4/¥16 的定价在国内开发者中间攒了一大波口碑。"又便宜又能打"是社区对 Kimi 最常见的评价。7 月 16 日 K3 一出来,输出价格直接从 ¥16 跳到 ¥100,涨了六倍多。新浪财经的标题是"很强,很贵,很爱给你炫技"。钛媒体拿 DeepSeek V4 Pro 的 ¥16 输出价做对比,¥100 vs ¥16,六倍差距写得清清楚楚。
但价格只是故事的一半。另一半是跑分——K3 确实在六项基准测试中拿了全球第一,覆盖编程、Agent 执行和文档理解三个方向。同时在 HLE-Full 推理测试上落后 Fable 5 近十分,在 DeepSWE 代码库理解上落后 GPT-5.6 五分半。
跑分表上的数字大家都能查到。这篇文章要做的不是重复列表,而是回答三个中文开发者真正关心的问题:K3 到底适合什么场景?跟 DeepSeek 和 GLM 比性价比怎么样?我现在用着 K2.6,该不该花六倍的钱升级?
数据来源:BenchLM 模型追踪、Artificial Analysis 综合指数、Arena.ai 排行榜、月之暗面官方技术博客,全部交叉验证过。月之暗面自测的跑分和独立第三方跑分,会在下文中明确标注。
先搞清一个基本概念:2.8 万亿参数到底什么意思
每次有新模型发布,"参数量"都是标题里最大的数字。K3 的 2.8 万亿听起来吓人,但必须拆开看。
K3 是 MoE(混合专家)架构,总共 896 个专家模块,每个 token 只激活其中 16 个。实际参与一次推理计算的参数大约 500 亿——换算下来跟一个大号稠密模型差不多。
打个比方:一个图书馆有 896 个专家坐在不同的房间里,每次你去咨询问题只会被带到其中 16 个专家面前。图书馆宣传"我们有 896 位专家"没有撒谎,但你每次获得的服务质量取决于那 16 位,不是 896 位。
为什么要说这个?因为朋友圈和公众号文章里已经出现了"K3 是 Fable 5 的 N 倍参数所以 N 倍聪明"这种说法。MoE 的总参数和稠密模型的总参数不是一回事。K3 确实很强,但不是因为它"有 2.8 万亿参数",而是因为它的架构设计、训练方法和 KDA 注意力机制在特定任务上效果好。
一句话判断标准: 看一个 MoE 模型的实力,看激活参数(K3 约 500 亿)和具体跑分成绩,不要看总参数量。
搞清了参数量的真实含义之后,下一个问题自然就来了:这 500 亿激活参数在实际任务上到底跑出了什么成绩?
¥100 买到了什么:K3 的能力画像
与其一项一项列跑分,不如先画一个整体画像。K3 的能力分布有一个非常鲜明的特点:执行类任务拉满,推理类任务中等偏上。
用一个类比来说:K3 像团队里那个特别能干活的工程师——你给他一个任务清单,他能一项一项高效完成,比谁都快。但如果让他独立设计一个全新的系统架构,他不是组里最强的那个人。
具体来看——
K3 真正领先的领域
长程编码执行。 SWE Marathon 42.0 分,全球第一。这个基准测试模拟的是在大型代码仓库里做连续多步修改——先定位问题、再理解上下文、然后写代码、跑测试、看结果、再改。一轮接一轮,十几步下来看谁不犯错。K3 得分比 Opus 4.8 高 2 分、比 GPT-5.6 高 3 分、比 Fable 5 高 7 分。
这个测试为什么重要?因为这就是 Cursor、Windsurf 这类编码 Agent 产品的核心使用场景。如果你在搭建类似的编码自动化流水线,SWE Marathon 是所有跑分里最直接相关的。
前端代码生成。 Arena.ai 的前端代码竞技场,K3 拿了 1,679 Elo,在七个前端领域里六个排第一,击败了 Fable 5(1,631)和 GPT-5.6(1,618)。但要注意——这个竞技场还比较新,投票数量远少于 LMArena 的主榜。在 LMArena 文本主榜上,K3 只有 1,486 Elo,不算顶级。
浏览器理解和任务自动化。 BrowseComp 91.2(第一),Automation Bench 30.8(第一,唯一突破 30 分的模型)。而且一个被忽略的细节:据报道 K3 比 K2.6 少消耗了 21% 的 token 就完成了全部自动化测试,分数反而高出 13 分。token 效率提升不只是分数好看——在 ¥100/百万 token 的价位上,少用 21% 的 token 等于直接省了 21% 的钱。
文档理解。 OmniDocBench 91.1(第一),比 Fable 5 高 1.3,比 GPT-5.6 高 5.3。这个测试用的是包含表格、图表、混合排版的复杂文档。做合同分析、财报提取、论文批量处理的团队应该重点关注这个分数。
K3 明确不行的领域
最难的推理题。 HLE-Full(人类最终考试全量版)K3 拿了 43.5 分,Fable 5 是 53.3 分。十分差距。这不是"稍微弱一点",这是明确的能力档次差异。HLE-Full 测的是跨学科、极高难度、开放式的推理——正是 K3 的短板。
单次深度代码理解。 DeepSWE 67.5,落后 GPT-5.6 的 73.0 整整五分半。DeepSWE 测的是"丢给你一个你没见过的大型代码仓库,在多个文件之间找到 bug 并修好"——需要一次性读懂整个项目架构。
这形成了一个很有意思的矛盾:K3 在 SWE Marathon(一步一步执行)上第一,在 DeepSWE(一次性看透)上第三。换句话说——你让 K3 干活它是最快的,让它做判断它不是最准的。
选模型的核心逻辑: 别问"K3 综合能力排第几"——这个问题对选型没用。要问"我的工作流到底是更需要持续执行还是一次性判断"。Agent 编码流水线、浏览器自动化、文档批处理——选 K3。学术推理、深度代码审查、复杂架构设计——选 Fable 5 或 GPT-5.6。
第三方怎么评:Artificial Analysis 给 K3 打了多少分
跑分都是选手自己报的成绩。裁判怎么说?
Artificial Analysis 是目前独立性最强的模型评测聚合平台之一,他们的 Intelligence Index 综合了多项基准测试给出一个总分。K3 的成绩:
- Intelligence Index 57.11 分,189 个模型里排第 4
- Coding Index 76.24
- Agentic Index 50.07
第 4 名意味着什么?跟 Opus 4.8 同一档,但低于 Fable 5 和 GPT-5.6 Sol。
值得一提的是,月之暗面在自己的发布博客里直接承认了这一点——"K3 整体表现仍略低于 Fable 5 和 GPT-5.6 Sol"。这种坦诚在国内大模型发布中比较少见。很多厂商只会把自己最好的跑分截图发出来,绝口不提弱项。月之暗面选择把第三方评价搬到台面上,至少在信息透明度这一点上是加分项。
还有一个数字常被忽略:输出速度 62 token/秒,首 token 延迟 1.99 秒。交互式使用没问题,但如果你跑大规模批量任务,延迟会累积。
第三方给出了全球排名,但中文开发者更关心的是一个不一样的参照系——K3 跟国内的 DeepSeek 和 GLM 比,到底怎么样?
国产模型战场:K3 vs DeepSeek vs GLM
中文开发者选型时很少只看 K3 和海外模型的对比。更现实的问题是:K3 跟 DeepSeek V4 Pro 和 GLM-5.2 比,性价比到底怎么样?
| Kimi K3 | DeepSeek V4 Pro | GLM-5.2 | |
|---|---|---|---|
| 输出价格 | ¥100/百万 token | ¥16/百万 token | ~¥30/百万 token |
| 上下文 | 100 万 | 128K | 128K |
| SWE Marathon | 42.0 | — | 13.0 |
| DeepSWE | 67.5 | — | 46.2 |
| Program Bench | 77.8 | — | 63.7 |
| BrowseComp | 91.2 | — | — |
| 开源权重 | 7/27 发布 | 已开源 | 已开源 |
| 定位 | Agent+编码旗舰 | 全能性价比 | 国产综合旗舰 |
直白地说:K3 在编程和 Agent 跑分上碾压 GLM-5.2,差距不是一点半点——Program Bench 77.8 vs 63.7,SWE Marathon 42.0 vs 13.0。如果你做的是编码 Agent 或自动化任务,K3 就是国产最强,没有第二个选项。
但这个"最强"的代价是 ¥100 的输出。DeepSeek V4 Pro 只要 ¥16。如果你的任务是通用问答、内容生成、客服对话这类对模型推理深度要求不高的场景——花六倍的钱用 K3 没有意义。DeepSeek 完全够用,省下来的预算可以做更多事情。
性价比判断标准: 算一笔简单的账。假设你每天调用 100 万 token 输出——用 K3 每天花 ¥100,用 DeepSeek 每天花 ¥16。一个月差 ¥2,520。如果 K3 在你的具体任务上确实比 DeepSeek 好很多,¥2,520 买的是质量提升,值得。如果差距不大,这 ¥2,520 就是纯浪费。先测,再算,再决定。
以上是横向对比。但还有一群人的问题更具体——他们已经在用月之暗面的模型了,只是想知道要不要花六倍的钱从 K2.6 升到 K3。
K2.6 老用户:花六倍价格升级 K3,到底值不值
这是一个非常具体的决策场景。我把关键数据放在一起:
| 指标 | K2.6 | K3 | 你要关注的 |
|---|---|---|---|
| Program Bench | 53.6 | 77.8 | 编程能力跳了一个档 |
| Kimi Code Bench | 62.0 | 72.9 | 自家测试也涨了 17% |
| 上下文 | 256K | 100 万 | 4 倍,长文档场景质变 |
| 输出价格 | ¥16 | ¥100 | 6.25 倍 |
| Token 效率 | 基准 | 省 21% | 同样任务更省 token |
Program Bench 从 53.6 到 77.8——这不是增量优化,这是两代产品之间的断层式提升。如果你之前用 K2.6 做编码 Agent 觉得"差点意思",K3 很可能解决你的问题。
但六倍价格也是实打实的。我的建议分三种情况:
第一种:你的核心流程依赖 Agent 连续编码或百万 token 上下文。 升级。K3 在这些场景上的能力提升是 K2.6 的价格永远换不来的。SWE Marathon 从 K2 时代的中等水平直接到了全球第一。
第二种:你主要用 Kimi 做简单的文本生成、翻译、总结。 别升级。K2.6 在这些场景上已经足够好,¥16 和 ¥100 之间的质量差距远小于价格差距。
第三种:你不确定。 先去 kimi.com 用免费额度跑你最常用的十个 prompt,跟 K2.6 API 的结果做盲测对比。如果你分不出来哪个更好——就说明 K3 对你的场景没有六倍的溢价价值。
省钱技巧: K3 的缓存命中输入价是 ¥2/百万 token,只有标准价 ¥20 的十分之一。如果你的流水线有稳定的 system prompt 重复发送,确保你的架构能触发缓存命中——这能砍掉大量输入成本。
成本控制红线: 不管你最终选了哪个模型,在正式接入生产前先算清楚三个数字——每天调用量上限、每月预算天花板、超支后的降级方案(比如从 K3 自动回落到 DeepSeek)。¥100 的输出价不可怕,没有 fallback 的架构才可怕。
升级决策做完了。但还有一层更深的问题——跑分成绩本身就完整可靠吗?
跑分表上看不到的五个真相
跑分告诉你模型能做什么,不告诉你它不能做什么。K3 有五个盲区值得在选型前弄清楚:
1. 百万 token 上下文没有经过独立的长距离检索验证。 月之暗面声称支持 100 万 token 上下文,BrowseComp 在 30 万 token 下跑出了 91.2 分。但 50 万甚至 100 万 token 长度下的 needle-in-a-haystack 测试结果——没有公开的独立数据。"支持 100 万"和"在 100 万长度下仍然准确"是两码事。
2. 目前只有"全力"推理模式。 K3 支持 reasoning_effort 参数但只开放了 max 一档。这意味着你无法用低成本模式处理简单请求——每次调用都在消耗最高推理算力,不管你问的是"1+1"还是"证明黎曼猜想"。低强度模式什么时候上线,月之暗面没说。
3. 独立 Arena 排名还在抖。 K3 在 LMArena 文本榜上 1,486 Elo,但置信区间 ±10.8,还比较大。Arena 排名需要几周的投票积累才能稳定——现在看到的排名可能高也可能低。
4. 已公布成绩只覆盖了全部跑分的六分之一。 BenchLM 追踪 313 项基准测试,K3 公布了 52 项。月之暗面当然会选自己最强的方向来展示——这很正常,每家都这样做。但你做决策时要意识到:你看到的是精选集,不是全景图。
5. 月之暗面的 Kimi Code Bench 是"自家裁判"。 K3 在 Kimi Code Bench 2.0 上拿了 72.9 分——但这个基准测试是月之暗面自己设计的。它不在行业标准评测套件里,其他厂商也没有在上面提交成绩。这个分数可以参考,但权重不应该和 SWE-bench、Program Bench 等行业公认基准测试相同。
评估 Rule of Thumb: 看一个模型的跑分时,先数它报了多少项。报 50 项里最好的 6 项跟报 300 项里最好的 6 项,含金量不一样。K3 目前 52/313——不低,但也不算透明度标杆。
知道了盲区之后,如果你时间有限,下面这张表可以直接帮你做决定。
如果只有五分钟:最短选型指南
不想看完全文也没关系。根据上面所有数据,以下是最精简的建议:
| 你在做什么 | 用什么 |
|---|---|
| 编码 Agent(Cursor 类场景) | K3 |
| 一次性深度代码审查 | GPT-5.6 Sol |
| 前端 / 组件生成 | K3 |
| 学术推理、复杂数学 | Fable 5 |
| 合同/财报/文档批处理 | K3 |
| RPA / 浏览器自动化 | K3 |
| 预算有限的通用场景 | DeepSeek V4 Pro |
| 需要自部署 | K3(7/27 以后) |
三步自测:不看跑分,用你自己的任务判断 K3
跑分文章能告诉你趋势,但最终决策只有你自己的测试才靠谱。以下是最省时间的自测方法:
第一步:准备 5 个代表性 prompt。 从你日常工作中挑 5 个最常用、最能体现质量差异的 prompt。编码任务至少占两个。
第二步:盲测对比。 打开 kimi.com(免费),同时打开你目前在用的模型(DeepSeek、GPT、Claude 都行)。同一个 prompt 分别跑两遍,不看来源,只看结果。记录哪个更好。
第三步:算账。 如果 K3 赢了 3 个以上——说明 ¥100 的溢价在你的场景有真实价值,值得切。如果只赢了 1–2 个——继续用便宜的,省下的钱可以多跑更多请求。如果一个都没赢——K3 不适合你现在的工作流,下个版本再看。
整个过程不到 30 分钟。比看 10 篇跑分文章更有用。
常见问题
K3 在所有跑分上都是第一吗? 不是。K3 在六项基准测试中全球第一(Program Bench、SWE Marathon、前端 Code Arena、BrowseComp、Automation Bench、OmniDocBench),但在 HLE-Full 推理上落后 Fable 5 近十分,DeepSWE 代码理解落后 GPT-5.6 五分半。Artificial Analysis 综合排名是 189 个模型里的第 4。
K3 适合替代 DeepSeek V4 Pro 吗? 看场景。编程和 Agent 类任务 K3 明显更强,但输出价格是 DeepSeek 的六倍多。通用文本任务性价比差距太大,不建议替代。只在 K3 的强项领域使用 K3,日常任务继续用 DeepSeek——这是目前最合理的配置。
K3 API 的缓存机制是怎么回事? 你发给 API 的输入 token 里,和上次请求开头部分完全一样的那些 token 可以走缓存价格——¥2/百万 token,只有标准价 ¥20 的十分之一。实际效果取决于你的 system prompt 有多长、请求之间的前缀有多稳定。做 RAG 或者批量处理时,固定长 system prompt 的架构能大幅降低输入成本。
现在用 K3 还是等 7 月 27 日开源权重? 如果你要自部署或微调——等。如果你想现在就用 K3 的能力——直接调 API,¥100 的输出价对大多数团队来说比租 GPU 集群便宜得多。2.8T 参数的自部署需要企业级硬件(64+ 加速器集群),普通显卡跑不了。
月之暗面说的"Fable 级体感"靠谱吗? 从跑分来看,K3 在编程和 Agent 任务上确实接近甚至超过 Fable 5。但在推理(HLE-Full 差十分)和通用代码理解(DeepSWE 差两分半)上还有明显差距。"Fable 级体感"这个说法在特定场景下成立,作为整体评价不准确。
写在最后
K3 最有价值的不是那六个第一名——而是它让中文开发者在编码 Agent 和任务自动化这两个赛道上有了一个不依赖海外 API 的顶级选择。
这句话放在两年前不可想象。2024 年,做 Agent 流水线只能选 Claude 或 GPT,没有第三条路。现在 K3 在 SWE Marathon 上比 Fable 5 高 7 分、比 GPT-5.6 高 3 分。在这个具体赛道上,国产模型是最强的——不是"接近",是确确实实的第一。
代价是 ¥100 的输出定价和 HLE-Full 推理上的差距。这是真实的限制,不应该被忽略。
你可以做的事情:打开 kimi.com,免费注册,拿你日常工作中最棘手的那个任务去跑一遍。你自己的判断比任何跑分文章都准。如果 K3 赢了——把相关流水线切过去。如果没赢——你省下了一次盲目跟风的成本,也没花一分钱。
作者
分类
更多文章
Wan 2.7 开源了吗?能免费用、能本地部署吗?(2026年5月最新)
阿里通义万相 Wan 2.7 开源状况全说清:Apache 2.0 可商用、ModelScope 和 HuggingFace 下载、24GB 显存起步、ComfyUI 本地部署步骤、和阿里云 API 版的区别。
Kimi K3 OpenRouter 接入指南:模型 ID、定价对比与缓存折扣陷阱(2026年7月)
Kimi K3 已上线 OpenRouter,模型 ID moonshotai/kimi-k3。$3/$15 定价与直连 API 一致,但没有 $0.30 缓存折扣。附接入代码、常见报错修复、直连 vs OpenRouter 选型对比。
Wan 2.7 使用技巧与隐藏功能:2026年15个进阶玩法
15个Wan 2.7实用技巧:从Prompt扩写妙用、种子锁定、多参考图层叠,到ComfyUI调度器优化、分辨率策略和信用分节省方法——这些是资深用户才知道的操作细节。
订阅简报
加入我们的社区
订阅我们的简报,获取最新动态与资讯