2026/07/15

Kimi K3 到底什么水平?2.5 万亿参数、百万上下文,实锤与传言逐条拆解(2026)

月之暗面 Kimi K3 泄露后全网在传。2.5T MoE、100 万 token 上下文、Kimi-Linear 是真是假?这篇逐条标注可信度,帮你在正式发布前判断值不值得关注。

Kimi K3 到底什么水平?2.5 万亿参数、百万上下文,实锤与传言逐条拆解(2026)

7 月 14 日晚上,有人注意到 Kimi 开放平台上多了一个充值赠送页面——标题写着"K3 上线",活动时间 7 月 15 日到 8 月 11 日。几个小时后页面被撤了,但截图已经传开。第二天 @Kimi_Moonshot 发了一段预告视频,六十多万浏览,六千点赞。

然后你打开 X、打开微信群、打开 Reddit,看到的是同一套说法:2.5 万亿参数、超过 GPT-5.6、比肩 Fable 5、开源可期。

问题是:这些说法里有多少站得住脚?

如果你在评估要不要在生产环境里试 K3,或者只是想搞清楚这波热度背后到底有多少干货,这篇能帮你省掉自己翻五六篇英文泄露稿和几十条推文的时间。我们交叉对照了泄露的平台页面、五篇独立的发布前报道、以及首日的 X 反馈,把每条信息都标上了可信度——高、中、低,或者直接标"矛盾"。

注意: 截至 2026 年 7 月 15 日,月之暗面没有发布 K3 的官方模型卡、基准测试分数、许可证或 API 价格表。下面所有内容来自泄露页面、第三方报道和早期使用者反馈。官方信息出来后我们会更新。

30 秒看懂 K3 是什么

Kimi K3 是月之暗面的下一代旗舰模型——一个 混合专家架构(MoE),总参数约 2.5 万亿,上下文窗口报道为 100 万 token 以上。它接在 K2 系列(K2、K2.5、K2.6、K2.7 Code)后面,属于换代级升级:K2.6 大约 1 万亿总参数、256K 上下文,K3 参数翻了一倍多,上下文翻了四倍。

下面逐项展开。

规格:哪些数字多个来源对得上

多个独立来源在几个核心数字上是一致的。对得上的我们标高可信度,只有单一来源或来源之间打架的标中或低:

规格报道数值可信度判断依据
架构混合专家(MoE)K2 系列一直是 MoE
总参数~2.5 万亿aibase 4 月路线图报道 + 多处泄露一致
激活参数每 token 约 40–100B各来源差异大,最低 40B 最高 100B
上下文100 万 token(有说 200 万)泄露页面 + 多位测试者确认
输入模态文本 + 图片 + 音频矛盾部分测试者说有,泄露汇总没提
语言50+ 种仅少数来源
训练数据15T+ token仅单一来源

2.5 万亿是什么概念?K2.6 约 1T,DeepSeek V4 Pro 约 1.6T,ERNIE 5.0 约 2.4T。如果数字准确,K3 直接排到目前公开参数量最大的模型之列。

经验法则: 总参数不等于推理时真正用到的参数。MoE 架构每个 token 只激活一部分专家,所以"2.5T"和一个 2.5T 的 Dense 模型是两回事。关注激活参数和实际推理速度,比关注总参数有用得多。

多模态:目前最说不清的一项

这里需要单独拎出来说,因为信息是矛盾的。

一边是部分早期测试者表示 K3 支持文本、图片、音频输入。另一边是几篇泄露汇总文章里完全没提多模态。月之暗面此前把 K2.7 Code 叫做"开源多模态模型",但 K2.7 的多模态是不是继承到了 K3、还是只属于 K2.7 那个分支,目前没人说得清楚。

保守结论:K3 的多模态能力算未确认,别把它当已有功能来做技术选型。

Kimi-Linear:百万上下文背后的技术

百万 token 上下文是这次最抓眼球的数字,但也是最需要技术支撑的——不是说参数堆上去就能用。

月之暗面 6 月底在 GitHub 上开源了一个叫 Kimi-Linear 的项目,代码和论文都有。这是一种线性注意力混合方案,通过选择性状态压缩来解决长上下文的核心瓶颈——KV cache 占用。据论文描述,Kimi-Linear 能把 KV cache 压缩约 75%,解码吞吐提升约 6 倍。K3 预计就是基于这项技术。

这为什么重要?目前大多数开放模型上下文上限在 128K 到 256K。就算声称支持更长上下文,实际部署时的显存需求会让成本飙升或者直接跑不起来。如果 Kimi-Linear 在 K3 上确实有效,那"100 万上下文"不是一个纸面参数,而是能在合理成本下真正用起来的能力

经验法则: 上下文窗口的标称值和实际可用值经常有差距。真正要判断一个长上下文模型能不能用,看两件事:一是"大海捞针"测试在不同位置的准确率有没有断崖下降,二是实际推理时每 token 的成本会不会随上下文长度指数级上升。等独立评测出来再下结论。

从 K2 到 K3:不是小改款

先看数字对比:

模型总参数上下文主打方向API 价格(输入/输出,每百万 token)
K2.6~1T MoE256KAgent 编码、工具调用$0.60 / $2.50
K2.7 Code~1T MoE256K编码专精,推理 token 减 30%$0.95 / $4.00
K3~2.5T MoE100 万+通用 + Agent + 多模态待公布

参数翻倍、上下文翻四倍。但更关键的背景是:K2.7 Code 在独立评测中表现一般。Kimi Code Bench v2 拿了 62.0 分(GPT-5.5 是 69.0),Program Bench 拿了 53.6 分(对比 69.1)。K3 看起来是月之暗面的调整策略——与其在编码细分方向上修修补补,不如整体拉大一个量级。

这个判断对不对,得看实测。

社区反馈:热度很高,评测为零

直说:目前没有任何官方基准测试。以下全是社区反馈,听个响。

看多的:

  • Jun Song(AI 研究员)用 Flappy Bird 编码测试了 K3 和 Opus 4.8,说 K3"明显更强",到了"Opus 5 水平"。但这是一个人做的一道题。
  • BridgeMind 说传言把 K3 放在"Claude Opus 4.7 档",但他们自己要等 BridgeBench 结果出来再说。
  • X 上多人报告 K3 在编码和推理上介于 GPT-5.6 和 Fable 5 之间。
  • 有人说这是开源领域的"DeepSeek 时刻"。

看空的:

  • @bijanbowen(328 赞)直接怼:"没自己跑过就别当水军。"

经验法则: 每个大模型发布的头 48 小时,X 上都会出现一批"这次真的颠覆一切"的帖子。历史数据是:大多数模型的实际独立评测成绩,比首日社区吹的水平低 10–20%。用单项编码任务的截图当基准测试看,跟用一张自拍当体检报告差不多——别信,等 Artificial Analysis、Chatbot Arena 或 SWE-bench Verified。

价格估算

官方价格没出。根据泄露页面和月之暗面的历史定价习惯,几家报道给出的估算如下:

估算范围对比参考
输入 / 百万 token$0.80–$1.20GLM 5.2 是 $1.40
输出 / 百万 token$3.50–$4.50GLM 5.2 是 $4.40
首发活动充值赠送 10–30%7/15–8/11

如果真是这个价,K3 用百万级上下文卖出了别人 128K 上下文的价钱。月之暗面一直走低价路线——K2.6 的 $0.60/$2.50 在同级别模型里本来就是最便宜的之一。

但注意:泄露出来的充值活动价格通常是首发优惠。K2.6 的价格确实长期稳定,但 K2.7 Code 一下跳到了 $0.95/$4.00。在官方价格表出来之前,别拿这些数字做容量预算。

现在能试吗

根据目前信息,K3 正在通过几个渠道陆续开放:

kimi.com 对话界面 — 最快的方式。有用户反馈 K3 已经出现在模型选项里。谷歌或手机号注册,不要信用卡,有免费额度。想知道 K3 对你的任务管不管用,花一分钟自己跑一下比看十条推文有用。

Kimi 开放平台 API — 泄露页面本身就在 platform.moonshot.cn 上。正式上线后大概率很快会出新的模型 ID。

开源权重 — K2 和 K2.6 都放了开源权重,所以 K3 开源是普遍预期。但有传言说 API 先行,权重可能推迟到 Q4。没确认,先别等。

第三方托管 — K2.6 在 AWS Marketplace、Together AI 等平台有。K3 正式发布后大概率跟进。

K3 在开放模型里排什么位置

没有官方评测的情况下,最公平的看法是:用 K2.6(月之暗面目前在线的模型)当下限,社区反馈当上限,看 K3 大概在什么区间。

Kimi K2.6Kimi K3(传言)InklingGLM 5.2
总参数~1T~2.5T975B~1.5T
上下文256K100 万+100 万(开源)/ 256K(托管)128K
SWE-bench Verified80.2%待定77.6%80.0%
AIME 202696.4%待定97.1%99.2%
多模态文本文本 + 图片 + 音频(未确认)文本 + 图片 + 视频 + 音频文本
开源权重预期

如果早期测试者说的"GPT-5.6 到 Fable 5 之间"是真的,K3 就是目前最强的开源权重模型。但"如果"两个字在这句话里承担了太多重量。

经验法则: 不要根据 X 帖子换生产模型。最低标准是:一个独立评测(Artificial Analysis、Chatbot Arena 或 SWE-bench Verified)+ 你自己在实际任务上的测试。做到这两条再做决定。

接下来几天盯什么

五件事,按重要性排:

  1. 官方模型卡和基准分数 — 没有 AIME、SWE-bench、MMMU、HLE 的官方成绩之前,所有性能说法都是段子。
  2. Chatbot Arena 和 Artificial Analysis 排名 — 最有公信力的独立评测。K3 可能已经以代号"Kivine"上了 Arena。
  3. 开源权重 — 放不放、什么时候放,决定了 K3 是加入开放权重阵营还是留在 API 围墙里。
  4. 正式定价 — 泄露活动页暗示了低价策略,但官方费率可能不同。
  5. 长上下文实测 — 百万级上下文是个很重的说法。独立的大海捞针测试和长上下文评测出来之前,这个能力打个问号。

常见问题

K3 发布了吗?

看起来在软发布阶段。官方发了预告视频,有人已经能在 kimi.com 上用到,但没有正式的带规格的公告。不算真正意义上的"发布"。

多大?

总参数约 2.5 万亿,MoE 架构。每个 token 激活的参数估计在 40–100B 之间——各来源差别很大,别太当真。

开源吗?

还没确认。K2 和 K2.6 都是开源权重的,所以 K3 开源被广泛预期,但不保证。有传言说权重可能推到 Q4。

跟 GPT-5.6 比呢?跟 Fable 5 呢?

早期测试者说介于两者之间。但没有一个独立基准测试验证过这个说法。

大概什么价格?

估算是输入 $0.80–$1.20、输出 $3.50–$4.50 每百万 token。如果准确,是同级别模型里最便宜的之一。但这是估算。

百万上下文是真的吗?

技术上有 Kimi-Linear 做支撑(代码和论文都公开了),可信度不低。但"标称支持"和"实际好用"之间有差距,等独立长上下文评测。

总结

K3 泄露出来的规格——2.5T MoE、百万上下文、多模态、激进定价——放在一起看确实是 2026 年到目前为止最值得关注的开放模型发布。

但这篇文章里反复出现的"待定""未确认""传言"不是我们在凑字数。这些标签代表的是:我们目前还没有足够的证据把说法升级为结论。

可以确定的:参数量、上下文窗口、大致价格区间——多个独立来源交叉对得上。

不能确定的:实际性能、多模态、开源时间线、正式定价——一个都没有官方来源。

如果你想自己判断,最直接的做法是去 kimi.com 注册一个账号,在你实际关心的任务上跑几遍。你自己跑出来的结果,比任何排行榜和推文都管用。官方规格和独立评测出来后,我们会更新这篇文章。

订阅简报

加入我们的社区

订阅我们的简报,获取最新动态与资讯