2026/07/17

Kimi K3 到底算不算开源?许可证、权重下载、自托管门槛全拆解(2026年7月)

Kimi K3 开放权重 7 月 27 日发布,Modified MIT 许可证。但'开源'到底意味着什么?拆解三个层面:拿不拿得到、用不用得了、商用有没有坑。附 DeepSeek/GLM 开源程度横评。

Kimi K3 到底算不算开源?许可证、权重下载、自托管门槛全拆解(2026年7月)

关于 K3 开源这件事,公众号文章、掘金帖子、朋友圈转发里流传着大量说法。其中至少有五条不准确。

不是恶意造假——大部分是对"开源"这两个字的理解不一样,或者把 K2 系列的情况直接套到了 K3 上,或者在发布第一天就写了"完全指南"但很多关键信息当时根本还没公布。

这篇文章做一件事:把网上最常见的五个说法拿出来,逐条核实,标清楚哪些是事实、哪些是误读、哪些还没有定论。 不吹不黑,只看来源。

信息来源:月之暗面微信公众号官方公告、github.com/MoonshotAI 组织页面截至 7 月 17 日的实际内容、K2/K2.6/K2.7 Code 在 GitHub 上的 LICENSE 文件原文、HuggingFace moonshotai 组织页实际数据。每条结论标注了依据。


说法一:"K3 开源了"

核实结果:不准确。

准确的说法有两层:

第一,K3 目前(7 月 17 日)没有开源,也没有开放权重。API 已上线,模型权重确认 7 月 27 日发布。在此之前你无法下载任何 K3 相关的模型文件。如果你现在在任何平台上看到"K3 开源权重下载"链接——那要么是 K2.6 的权重被贴了 K3 标题,要么是假的。

第二,即使 7 月 27 日发布,K3 也不是"开源"——而是"开放权重"。这个区别在知乎上讨论了无数遍但公众号文章很少区分:

  • 开源(open source) = 公开训练数据 + 训练代码 + 模型权重 + 复现流水线。按 OSI(开源促进会)的标准,能让第三方从零重建出同样的模型。
  • 开放权重(open weight) = 只公开训练好的模型参数。你能下载、推理、微调、商用,但不能从零复现训练过程。

月之暗面从来没有公开过任何模型的训练数据或完整训练代码。K2 系列如此,K3 大概率也是如此。

这个区别什么时候真的重要: 大多数时候不重要——开发者只需要权重就能做应用。但如果你的甲方合同里写了"必须使用开源模型"、或者你的项目需要通过某些合规审查——"开放权重"和"开源"在法律和采购层面是不同的东西。提前跟法务确认。

怎么自己验证 K3 是否已发布:github.com/MoonshotAI 看有没有 Kimi-K3 仓库。没有就是没发。不要相信任何第三方说法——两秒钟自己看一眼比读十篇文章准。

知道了 K3 还没开源、将来也只是"开放权重"——下一个问题自然是:拿到权重后,我的项目能不能商用?这就涉及许可证了。


说法二:"Modified MIT 跟 MIT 一样,随便用"

核实结果:大方向对,但细节上有两个坑。

K2 系列全线使用 Modified MIT 许可证。K3 大概率沿用(正式条款以 7 月 27 日模型卡为准)。Modified MIT 确实允许商用——做产品、卖服务、微调后分发、量化后托管——都可以。这一点跟标准 MIT 一样。

但标准 MIT 只有四句话、零限制。Modified MIT 多了东西。K2 系列许可证里至少有两个附加条款是标准 MIT 里不存在的:

坑一:MAU 商业门槛

K2.7 Code 的 Modified MIT 规定:你的产品或服务月活用户(MAU)超过一定阈值时,需要向月之暗面申请单独的商业授权。K2.6 的门槛是 1 亿 MAU。

一亿月活——离绝大多数团队很远。但做 ToB 私有化交付的要注意:你给客户 A 部署一套、给客户 B 部署一套、给客户 C 部署一套——这些实例上的用户量是加在一起算的。十个客户、每个几百万用户——就不那么远了。

坑二:合成数据不受许可保护

K2 的 Modified MIT 原文有一条:用模型生成的文本(合成数据)不受这份许可证保护。具体含义是——如果你用 K3 生成了一批文本,再用这批文本去训练一个新模型,你不能对外说"我的新模型也是 Modified MIT 许可的"。

这对做"用大模型生成数据→训练小模型→部署小模型"流水线的团队有直接影响。你的小模型需要单独的许可安排。

法务需要看的不是这篇文章,是许可证原文。 7 月 27 日 K3 仓库上线后,让法务打开 LICENSE 文件逐条过。重点看三样东西:MAU 具体数字、合成数据条款有没有变化、有没有新增使用禁令(军事/监控/深度伪造等)。K2 系列没有明确的使用禁令,但 2026 年的监管环境不一样了——K3 有可能加。

许可证的问题说清楚了——但很多人对月之暗面到底公开了多少东西,认知偏差更大。


说法三:"月之暗面只开源了模型权重,没别的"

核实结果:不准确。公开的东西比大多数人以为的多。

月之暗面在 GitHub 上(github.com/MoonshotAI)已经公开了至少四类东西:

第一类:模型权重(Modified MIT)。 K2、K2.5、K2.6、K2.7 Code——全部在 GitHub 和 HuggingFace 上可下载。K2.6 的 HuggingFace 下载量超过 146 万次,社区做了 42+ 个 GGUF 量化版本。这是一个有真实使用量的生态,不是做样子。

第二类:完整的研究项目(标准 MIT,最宽松)。 Kimi-Linear 项目公开了代码、论文和 48B 模型 checkpoint(Base + Instruct 两个版本)。这不是"发了个权重就完事"——是代码+论文+模型的完整研究发布。而且用的是标准 MIT 许可证,比 K3 预期的 Modified MIT 更宽松。

为什么 Kimi-Linear 值得特别关注?因为它就是 K3 百万 token 上下文背后的核心技术。K3 用的 Kimi Delta Attention(KDA)直接从 Kimi-Linear 的架构演进而来。月之暗面选择用标准 MIT 发布这个——意味着 K3 最核心的注意力机制创新已经完全公开、可复现、可商用。

第三类:视觉语言模型。 Kimi-VL,MoE 架构的多模态模型,也在 GitHub 上。

第四类:对上游开源库的贡献。 月之暗面向 FLA(Flash Linear Attention)开源库贡献了 KDA kernel 实现。这意味着 K3 的注意力计算不是封闭的黑盒——外部开发者可以在 FLA 库里看到它的实现、提 issue、甚至提交改进。

重新理解月之暗面的开源策略: 它不是"把权重丢出来让你自己玩"。它是分层开放——基础研究(Kimi-Linear)用最宽松的标准 MIT,应用级模型(K2/K3)用有限制的 Modified MIT,训练数据和训练流程保持私有。每一层的开放程度跟它的商业敏感度反相关。这是一个经过设计的策略,不是随机的。

月之暗面开放了不少东西——但你下载权重之后真的能跑起来吗?第四个说法关乎实际部署。


说法四:"7 月 27 日权重发布后就能本地跑"

核实结果:硬件到位也大概率跑不了。

硬件门槛的问题(8× A800/H800 起步、消费级卡完全不行)在 HuggingFace 文章里说过了,这里不重复。说一个很多人不知道的问题:推理工具链还没准备好。

K3 的注意力机制是 KDA with Attention Residuals(AttnRes),不是标准 Transformer attention,也不是 K2 系列用的 MLA。它需要专门的 CUDA kernel 来执行推理。

截至 7 月 17 日:

  • llama.cpp:不支持 KDA
  • Ollama:不支持
  • LM Studio:不支持
  • vLLM:部分支持(月之暗面向 FLA 库提交了 KDA kernel,但完整集成还在进行中)

这意味着你 7 月 27 日下载了 1.5 TB 的权重,装在 8 卡集群上——然后发现没有推理引擎能加载它。你需要等月之暗面随权重一起发布官方推理代码,或者等 vLLM/SGLang 完成适配。

K2.6 的经验是:权重发布后大约 2–4 周,社区推理工具链基本可用。照这个节奏推算,K3 的自部署在 8 月中下旬之前大概率无法生产可用。

给急着部署的人: 现在用 K3 API(kimi.com 免费、platform.moonshot.cn 付费),同时在集群上把 K2.6 跑通——确认你的推理流水线正常。7 月 27 日之后,先看 K3 仓库的 README 支持哪些推理框架。支持你在用的框架了再下载权重——别反过来。

前面四条核实的都是技术事实。最后一条不是技术问题——是动机问题。


说法五:"K3 开源是因为月之暗面大方"

核实结果:这是一个商业策略,不是慈善行为。

这条不是"错误"——而是误读了开源的动机。

开放权重对月之暗面有三个直接的商业好处:

第一:降低 API 获客成本。 开发者在本地试用了 K2.6,觉得好用,然后在生产环境用 K3 API——因为自部署 K3 的门槛太高(8 卡集群起步),大多数团队最终还是会选择 API。开放权重不是替代 API——它是 API 的前置漏斗。

第二:建立开发者生态。 社区做量化版本、写部署教程、开发适配工具——这些工作月之暗面不需要自己做,但它增加了 Kimi 系列的市场存在感和开发者黏性。K2.6 的 42 个社区量化版本和 146 万次下载就是这个效果。

第三:竞争压力。 DeepSeek V4 Pro 用标准 MIT 全面开源、GLM-5.2 也开放了权重——如果月之暗面不跟进,它在"国产开源大模型"这条赛道上会被边缘化。在中国 AI 社区,"不开源"几乎等于"不自信"。开放权重是维持竞争地位的必要动作。

把三家放在一起看更清楚:

维度K3(月之暗面,预期)DeepSeek V4 ProGLM-5.2(智谱)
许可证Modified MIT标准 MIT开放权重(具体条款见仓库)
商用✅ 允许✅ 允许✅ 允许
MAU 门槛有(K2.7 先例,具体数字待确认)
合成数据限制有(不受许可保护)
训练数据公开
训练代码公开

三家都不公开训练数据和训练代码——这一点上没有区别。区别在许可证的附加条款:DeepSeek 用的是最干净的标准 MIT,月之暗面多了 MAU 和合成数据两个限制。对大多数中小团队不构成影响。对年 MAU 过亿的大规模部署——K3 和 DeepSeek 的许可成本差距是实质性的。

理解这个背景有什么用?它帮你预测 K3 开源之后月之暗面会做什么。它会持续优化 API(因为 API 是赚钱的业务),会在许可证上留出商业限制(MAU 门槛、合成数据条款),会让社区做量化和适配的脏活——但它不会公开训练数据和训练流程(这是核心竞争力)。

用一句话理解 K3 的开源定位: 月之暗面把 K3 的"使用权"开放了,但没有把 K3 的"制造方法"开放。你可以用它做任何事情——但你不能绕过月之暗面从零造出一个 K3。


那 K3 开源后你该做什么

不同身份,动作不一样:

你是谁7 月 27 日该做的第一件事
独立开发者什么都不做。继续用 API——自部署 K3 对个人来说既不现实也不划算。关注第三方推理平台(硅基流动、Together AI)上架 K3,它们通常比官方 API 便宜
AI 创业团队打开 LICENSE 文件,让法务看 MAU 门槛和合成数据条款。确认你的商业模式不会在 scale up 后踩雷
企业 IT 部门评估许可证是否满足你的合规要求(注意:K3 是"开放权重"不是"开源")。如果有私有化部署需求——等推理工具链成熟后再动(8 月中下旬估计)
学术研究者先看 Kimi-Linear(标准 MIT、代码论文模型全公开)——它比 K3 权重本身对你的研究更有用。K3 的 KDA 注意力机制的参考实现在那里
要做 ToB 私有化交付的查清楚 MAU 是怎么算的——你所有客户实例上的用户加在一起是否接近门槛。如果是——提前跟月之暗面沟通商业授权

常见问题

K3 是开源的吗?

K3 是"开放权重",不是 OSI 定义的"开源"。你可以下载权重、推理、微调、商用。但训练数据和训练代码不公开。对大多数应用场景不影响。对合规有 OSI 要求的项目是一个法律区别。

Modified MIT 和标准 MIT 有什么区别?

标准 MIT 只有四句话、零限制。Modified MIT 在此基础上增加了附加条款——K2 系列已知的包括 MAU 商业门槛和合成数据不受许可保护。K3 的具体条款以 7 月 27 日发布的 LICENSE 文件为准。

K3 和 DeepSeek V4 Pro 比,谁的许可证更宽松?

DeepSeek V4 Pro 用标准 MIT,无 MAU 门槛、无合成数据限制。K3 的 Modified MIT 多了这两个条款。对大多数中小团队影响不大,对月活过千万的大规模部署需要留意。

K3 的权重什么时候能下载?

7 月 27 日。在此之前 GitHub 和 HuggingFace 上都没有 K3 仓库。你可以先用 API(kimi.com 免费 / platform.moonshot.cn 付费)。

下载后能立刻部署吗?

大概率不能。K3 的 KDA 注意力机制在主流推理框架(llama.cpp、Ollama、LM Studio)上还未适配。vLLM 有部分支持。实际可用预计在权重发布后 2–4 周。


最后

"K3 开源了"——在网上看到这五个字的时候,你现在知道了它的五层真相:

它还没发布(7 月 27 日)。它不是"开源"是"开放权重"。它的许可证不是标准 MIT,有附加条款。下载了权重你大概率也跑不起来。月之暗面把它开放不是因为大方,是因为这在商业上说得通。

每一条都不影响 K3 是一个很强的模型——它在编程 Agent 和浏览器自动化上确实是全球第一。开放权重对整个行业来说是好事——更多竞争、更低价格、更多选择。

但你做决策的时候应该基于事实,不是基于标题。

7 月 27 日那天:先打开 LICENSE 文件,再打开 README,最后再决定下不下载。

订阅简报

加入我们的社区

订阅我们的简报,获取最新动态与资讯