Kimi K3 到底什么水平?2.5 万亿参数、百万上下文,实锤与传言逐条拆解(2026)
月之暗面 Kimi K3 泄露后全网在传。2.5T MoE、100 万 token 上下文、Kimi-Linear 是真是假?这篇逐条标注可信度,帮你在正式发布前判断值不值得关注。

7 月 14 日晚上,有人注意到 Kimi 开放平台上多了一个充值赠送页面——标题写着"K3 上线",活动时间 7 月 15 日到 8 月 11 日。几个小时后页面被撤了,但截图已经传开。第二天 @Kimi_Moonshot 发了一段预告视频,六十多万浏览,六千点赞。
然后你打开 X、打开微信群、打开 Reddit,看到的是同一套说法:2.5 万亿参数、超过 GPT-5.6、比肩 Fable 5、开源可期。
问题是:这些说法里有多少站得住脚?
如果你在评估要不要在生产环境里试 K3,或者只是想搞清楚这波热度背后到底有多少干货,这篇能帮你省掉自己翻五六篇英文泄露稿和几十条推文的时间。我们交叉对照了泄露的平台页面、五篇独立的发布前报道、以及首日的 X 反馈,把每条信息都标上了可信度——高、中、低,或者直接标"矛盾"。
注意: 截至 2026 年 7 月 15 日,月之暗面没有发布 K3 的官方模型卡、基准测试分数、许可证或 API 价格表。下面所有内容来自泄露页面、第三方报道和早期使用者反馈。官方信息出来后我们会更新。
30 秒看懂 K3 是什么
Kimi K3 是月之暗面的下一代旗舰模型——一个 混合专家架构(MoE),总参数约 2.5 万亿,上下文窗口报道为 100 万 token 以上。它接在 K2 系列(K2、K2.5、K2.6、K2.7 Code)后面,属于换代级升级:K2.6 大约 1 万亿总参数、256K 上下文,K3 参数翻了一倍多,上下文翻了四倍。
下面逐项展开。
规格:哪些数字多个来源对得上
多个独立来源在几个核心数字上是一致的。对得上的我们标高可信度,只有单一来源或来源之间打架的标中或低:
| 规格 | 报道数值 | 可信度 | 判断依据 |
|---|---|---|---|
| 架构 | 混合专家(MoE) | 高 | K2 系列一直是 MoE |
| 总参数 | ~2.5 万亿 | 高 | aibase 4 月路线图报道 + 多处泄露一致 |
| 激活参数 | 每 token 约 40–100B | 中 | 各来源差异大,最低 40B 最高 100B |
| 上下文 | 100 万 token(有说 200 万) | 高 | 泄露页面 + 多位测试者确认 |
| 输入模态 | 文本 + 图片 + 音频 | 矛盾 | 部分测试者说有,泄露汇总没提 |
| 语言 | 50+ 种 | 中 | 仅少数来源 |
| 训练数据 | 15T+ token | 低 | 仅单一来源 |
2.5 万亿是什么概念?K2.6 约 1T,DeepSeek V4 Pro 约 1.6T,ERNIE 5.0 约 2.4T。如果数字准确,K3 直接排到目前公开参数量最大的模型之列。
经验法则: 总参数不等于推理时真正用到的参数。MoE 架构每个 token 只激活一部分专家,所以"2.5T"和一个 2.5T 的 Dense 模型是两回事。关注激活参数和实际推理速度,比关注总参数有用得多。
多模态:目前最说不清的一项
这里需要单独拎出来说,因为信息是矛盾的。
一边是部分早期测试者表示 K3 支持文本、图片、音频输入。另一边是几篇泄露汇总文章里完全没提多模态。月之暗面此前把 K2.7 Code 叫做"开源多模态模型",但 K2.7 的多模态是不是继承到了 K3、还是只属于 K2.7 那个分支,目前没人说得清楚。
保守结论:K3 的多模态能力算未确认,别把它当已有功能来做技术选型。
Kimi-Linear:百万上下文背后的技术
百万 token 上下文是这次最抓眼球的数字,但也是最需要技术支撑的——不是说参数堆上去就能用。
月之暗面 6 月底在 GitHub 上开源了一个叫 Kimi-Linear 的项目,代码和论文都有。这是一种线性注意力混合方案,通过选择性状态压缩来解决长上下文的核心瓶颈——KV cache 占用。据论文描述,Kimi-Linear 能把 KV cache 压缩约 75%,解码吞吐提升约 6 倍。K3 预计就是基于这项技术。
这为什么重要?目前大多数开放模型上下文上限在 128K 到 256K。就算声称支持更长上下文,实际部署时的显存需求会让成本飙升或者直接跑不起来。如果 Kimi-Linear 在 K3 上确实有效,那"100 万上下文"不是一个纸面参数,而是能在合理成本下真正用起来的能力。
经验法则: 上下文窗口的标称值和实际可用值经常有差距。真正要判断一个长上下文模型能不能用,看两件事:一是"大海捞针"测试在不同位置的准确率有没有断崖下降,二是实际推理时每 token 的成本会不会随上下文长度指数级上升。等独立评测出来再下结论。
从 K2 到 K3:不是小改款
先看数字对比:
| 模型 | 总参数 | 上下文 | 主打方向 | API 价格(输入/输出,每百万 token) |
|---|---|---|---|---|
| K2.6 | ~1T MoE | 256K | Agent 编码、工具调用 | $0.60 / $2.50 |
| K2.7 Code | ~1T MoE | 256K | 编码专精,推理 token 减 30% | $0.95 / $4.00 |
| K3 | ~2.5T MoE | 100 万+ | 通用 + Agent + 多模态 | 待公布 |
参数翻倍、上下文翻四倍。但更关键的背景是:K2.7 Code 在独立评测中表现一般。Kimi Code Bench v2 拿了 62.0 分(GPT-5.5 是 69.0),Program Bench 拿了 53.6 分(对比 69.1)。K3 看起来是月之暗面的调整策略——与其在编码细分方向上修修补补,不如整体拉大一个量级。
这个判断对不对,得看实测。
社区反馈:热度很高,评测为零
直说:目前没有任何官方基准测试。以下全是社区反馈,听个响。
看多的:
- Jun Song(AI 研究员)用 Flappy Bird 编码测试了 K3 和 Opus 4.8,说 K3"明显更强",到了"Opus 5 水平"。但这是一个人做的一道题。
- BridgeMind 说传言把 K3 放在"Claude Opus 4.7 档",但他们自己要等 BridgeBench 结果出来再说。
- X 上多人报告 K3 在编码和推理上介于 GPT-5.6 和 Fable 5 之间。
- 有人说这是开源领域的"DeepSeek 时刻"。
看空的:
- @bijanbowen(328 赞)直接怼:"没自己跑过就别当水军。"
经验法则: 每个大模型发布的头 48 小时,X 上都会出现一批"这次真的颠覆一切"的帖子。历史数据是:大多数模型的实际独立评测成绩,比首日社区吹的水平低 10–20%。用单项编码任务的截图当基准测试看,跟用一张自拍当体检报告差不多——别信,等 Artificial Analysis、Chatbot Arena 或 SWE-bench Verified。
价格估算
官方价格没出。根据泄露页面和月之暗面的历史定价习惯,几家报道给出的估算如下:
| 估算范围 | 对比参考 | |
|---|---|---|
| 输入 / 百万 token | $0.80–$1.20 | GLM 5.2 是 $1.40 |
| 输出 / 百万 token | $3.50–$4.50 | GLM 5.2 是 $4.40 |
| 首发活动 | 充值赠送 10–30% | 7/15–8/11 |
如果真是这个价,K3 用百万级上下文卖出了别人 128K 上下文的价钱。月之暗面一直走低价路线——K2.6 的 $0.60/$2.50 在同级别模型里本来就是最便宜的之一。
但注意:泄露出来的充值活动价格通常是首发优惠。K2.6 的价格确实长期稳定,但 K2.7 Code 一下跳到了 $0.95/$4.00。在官方价格表出来之前,别拿这些数字做容量预算。
现在能试吗
根据目前信息,K3 正在通过几个渠道陆续开放:
kimi.com 对话界面 — 最快的方式。有用户反馈 K3 已经出现在模型选项里。谷歌或手机号注册,不要信用卡,有免费额度。想知道 K3 对你的任务管不管用,花一分钟自己跑一下比看十条推文有用。
Kimi 开放平台 API — 泄露页面本身就在 platform.moonshot.cn 上。正式上线后大概率很快会出新的模型 ID。
开源权重 — K2 和 K2.6 都放了开源权重,所以 K3 开源是普遍预期。但有传言说 API 先行,权重可能推迟到 Q4。没确认,先别等。
第三方托管 — K2.6 在 AWS Marketplace、Together AI 等平台有。K3 正式发布后大概率跟进。
K3 在开放模型里排什么位置
没有官方评测的情况下,最公平的看法是:用 K2.6(月之暗面目前在线的模型)当下限,社区反馈当上限,看 K3 大概在什么区间。
| Kimi K2.6 | Kimi K3(传言) | Inkling | GLM 5.2 | |
|---|---|---|---|---|
| 总参数 | ~1T | ~2.5T | 975B | ~1.5T |
| 上下文 | 256K | 100 万+ | 100 万(开源)/ 256K(托管) | 128K |
| SWE-bench Verified | 80.2% | 待定 | 77.6% | 80.0% |
| AIME 2026 | 96.4% | 待定 | 97.1% | 99.2% |
| 多模态 | 文本 | 文本 + 图片 + 音频(未确认) | 文本 + 图片 + 视频 + 音频 | 文本 |
| 开源权重 | 有 | 预期 | 有 | 有 |
如果早期测试者说的"GPT-5.6 到 Fable 5 之间"是真的,K3 就是目前最强的开源权重模型。但"如果"两个字在这句话里承担了太多重量。
经验法则: 不要根据 X 帖子换生产模型。最低标准是:一个独立评测(Artificial Analysis、Chatbot Arena 或 SWE-bench Verified)+ 你自己在实际任务上的测试。做到这两条再做决定。
接下来几天盯什么
五件事,按重要性排:
- 官方模型卡和基准分数 — 没有 AIME、SWE-bench、MMMU、HLE 的官方成绩之前,所有性能说法都是段子。
- Chatbot Arena 和 Artificial Analysis 排名 — 最有公信力的独立评测。K3 可能已经以代号"Kivine"上了 Arena。
- 开源权重 — 放不放、什么时候放,决定了 K3 是加入开放权重阵营还是留在 API 围墙里。
- 正式定价 — 泄露活动页暗示了低价策略,但官方费率可能不同。
- 长上下文实测 — 百万级上下文是个很重的说法。独立的大海捞针测试和长上下文评测出来之前,这个能力打个问号。
常见问题
K3 发布了吗?
看起来在软发布阶段。官方发了预告视频,有人已经能在 kimi.com 上用到,但没有正式的带规格的公告。不算真正意义上的"发布"。
多大?
总参数约 2.5 万亿,MoE 架构。每个 token 激活的参数估计在 40–100B 之间——各来源差别很大,别太当真。
开源吗?
还没确认。K2 和 K2.6 都是开源权重的,所以 K3 开源被广泛预期,但不保证。有传言说权重可能推到 Q4。
跟 GPT-5.6 比呢?跟 Fable 5 呢?
早期测试者说介于两者之间。但没有一个独立基准测试验证过这个说法。
大概什么价格?
估算是输入 $0.80–$1.20、输出 $3.50–$4.50 每百万 token。如果准确,是同级别模型里最便宜的之一。但这是估算。
百万上下文是真的吗?
技术上有 Kimi-Linear 做支撑(代码和论文都公开了),可信度不低。但"标称支持"和"实际好用"之间有差距,等独立长上下文评测。
总结
K3 泄露出来的规格——2.5T MoE、百万上下文、多模态、激进定价——放在一起看确实是 2026 年到目前为止最值得关注的开放模型发布。
但这篇文章里反复出现的"待定""未确认""传言"不是我们在凑字数。这些标签代表的是:我们目前还没有足够的证据把说法升级为结论。
可以确定的:参数量、上下文窗口、大致价格区间——多个独立来源交叉对得上。
不能确定的:实际性能、多模态、开源时间线、正式定价——一个都没有官方来源。
如果你想自己判断,最直接的做法是去 kimi.com 注册一个账号,在你实际关心的任务上跑几遍。你自己跑出来的结果,比任何排行榜和推文都管用。官方规格和独立评测出来后,我们会更新这篇文章。
作者
分类
更多文章
Wan 2.7 在线使用指南:8个免费平台横向对比(2026)
不需要GPU!汇总所有可以在线使用Wan 2.7的平台:通义万相、阿里云百炼、HuggingFace、Invideo、Picsart、fal.ai、Tensor Art、wan27.org。对比功能、价格、限制,帮你找到最合适的平台。
Nemotron 3 Ultra:专为长时 Agent 设计的 550B MoE 推理模型
Nemotron 3 Ultra 是什么?550B 参数、55B 活跃、Hybrid Mamba-Transformer、NVFP4、多 token 预测——这些技术参数到底意味着什么。本文从架构到场景,帮你快速判断它适合做什么、不适合做什么。

Wan 2.2 模型文件完全解读:文件名密码、5B vs 14B 与完整下载清单 (2026)
Wan 2.2 有几十个模型文件,文件名长得像密码。本文拆解每个文件名含义、T2V/I2V/T2I2V 怎么选、5B 和 14B 的显存需求、High/Low Noise 区别、VAE 为什么必不可少,以及按硬件推荐的完整下载清单。
订阅简报
加入我们的社区
订阅我们的简报,获取最新动态与资讯