Kimi K3 到底算不算开源?许可证、权重下载、自托管门槛全拆解(2026年7月)
Kimi K3 开放权重 7 月 27 日发布,Modified MIT 许可证。但'开源'到底意味着什么?拆解三个层面:拿不拿得到、用不用得了、商用有没有坑。附 DeepSeek/GLM 开源程度横评。
关于 K3 开源这件事,公众号文章、掘金帖子、朋友圈转发里流传着大量说法。其中至少有五条不准确。
不是恶意造假——大部分是对"开源"这两个字的理解不一样,或者把 K2 系列的情况直接套到了 K3 上,或者在发布第一天就写了"完全指南"但很多关键信息当时根本还没公布。
这篇文章做一件事:把网上最常见的五个说法拿出来,逐条核实,标清楚哪些是事实、哪些是误读、哪些还没有定论。 不吹不黑,只看来源。
信息来源:月之暗面微信公众号官方公告、github.com/MoonshotAI 组织页面截至 7 月 17 日的实际内容、K2/K2.6/K2.7 Code 在 GitHub 上的 LICENSE 文件原文、HuggingFace moonshotai 组织页实际数据。每条结论标注了依据。
说法一:"K3 开源了"
核实结果:不准确。
准确的说法有两层:
第一,K3 目前(7 月 17 日)没有开源,也没有开放权重。API 已上线,模型权重确认 7 月 27 日发布。在此之前你无法下载任何 K3 相关的模型文件。如果你现在在任何平台上看到"K3 开源权重下载"链接——那要么是 K2.6 的权重被贴了 K3 标题,要么是假的。
第二,即使 7 月 27 日发布,K3 也不是"开源"——而是"开放权重"。这个区别在知乎上讨论了无数遍但公众号文章很少区分:
- 开源(open source) = 公开训练数据 + 训练代码 + 模型权重 + 复现流水线。按 OSI(开源促进会)的标准,能让第三方从零重建出同样的模型。
- 开放权重(open weight) = 只公开训练好的模型参数。你能下载、推理、微调、商用,但不能从零复现训练过程。
月之暗面从来没有公开过任何模型的训练数据或完整训练代码。K2 系列如此,K3 大概率也是如此。
这个区别什么时候真的重要: 大多数时候不重要——开发者只需要权重就能做应用。但如果你的甲方合同里写了"必须使用开源模型"、或者你的项目需要通过某些合规审查——"开放权重"和"开源"在法律和采购层面是不同的东西。提前跟法务确认。
怎么自己验证 K3 是否已发布: 去 github.com/MoonshotAI 看有没有 Kimi-K3 仓库。没有就是没发。不要相信任何第三方说法——两秒钟自己看一眼比读十篇文章准。
知道了 K3 还没开源、将来也只是"开放权重"——下一个问题自然是:拿到权重后,我的项目能不能商用?这就涉及许可证了。
说法二:"Modified MIT 跟 MIT 一样,随便用"
核实结果:大方向对,但细节上有两个坑。
K2 系列全线使用 Modified MIT 许可证。K3 大概率沿用(正式条款以 7 月 27 日模型卡为准)。Modified MIT 确实允许商用——做产品、卖服务、微调后分发、量化后托管——都可以。这一点跟标准 MIT 一样。
但标准 MIT 只有四句话、零限制。Modified MIT 多了东西。K2 系列许可证里至少有两个附加条款是标准 MIT 里不存在的:
坑一:MAU 商业门槛
K2.7 Code 的 Modified MIT 规定:你的产品或服务月活用户(MAU)超过一定阈值时,需要向月之暗面申请单独的商业授权。K2.6 的门槛是 1 亿 MAU。
一亿月活——离绝大多数团队很远。但做 ToB 私有化交付的要注意:你给客户 A 部署一套、给客户 B 部署一套、给客户 C 部署一套——这些实例上的用户量是加在一起算的。十个客户、每个几百万用户——就不那么远了。
坑二:合成数据不受许可保护
K2 的 Modified MIT 原文有一条:用模型生成的文本(合成数据)不受这份许可证保护。具体含义是——如果你用 K3 生成了一批文本,再用这批文本去训练一个新模型,你不能对外说"我的新模型也是 Modified MIT 许可的"。
这对做"用大模型生成数据→训练小模型→部署小模型"流水线的团队有直接影响。你的小模型需要单独的许可安排。
法务需要看的不是这篇文章,是许可证原文。 7 月 27 日 K3 仓库上线后,让法务打开 LICENSE 文件逐条过。重点看三样东西:MAU 具体数字、合成数据条款有没有变化、有没有新增使用禁令(军事/监控/深度伪造等)。K2 系列没有明确的使用禁令,但 2026 年的监管环境不一样了——K3 有可能加。
许可证的问题说清楚了——但很多人对月之暗面到底公开了多少东西,认知偏差更大。
说法三:"月之暗面只开源了模型权重,没别的"
核实结果:不准确。公开的东西比大多数人以为的多。
月之暗面在 GitHub 上(github.com/MoonshotAI)已经公开了至少四类东西:
第一类:模型权重(Modified MIT)。 K2、K2.5、K2.6、K2.7 Code——全部在 GitHub 和 HuggingFace 上可下载。K2.6 的 HuggingFace 下载量超过 146 万次,社区做了 42+ 个 GGUF 量化版本。这是一个有真实使用量的生态,不是做样子。
第二类:完整的研究项目(标准 MIT,最宽松)。 Kimi-Linear 项目公开了代码、论文和 48B 模型 checkpoint(Base + Instruct 两个版本)。这不是"发了个权重就完事"——是代码+论文+模型的完整研究发布。而且用的是标准 MIT 许可证,比 K3 预期的 Modified MIT 更宽松。
为什么 Kimi-Linear 值得特别关注?因为它就是 K3 百万 token 上下文背后的核心技术。K3 用的 Kimi Delta Attention(KDA)直接从 Kimi-Linear 的架构演进而来。月之暗面选择用标准 MIT 发布这个——意味着 K3 最核心的注意力机制创新已经完全公开、可复现、可商用。
第三类:视觉语言模型。 Kimi-VL,MoE 架构的多模态模型,也在 GitHub 上。
第四类:对上游开源库的贡献。 月之暗面向 FLA(Flash Linear Attention)开源库贡献了 KDA kernel 实现。这意味着 K3 的注意力计算不是封闭的黑盒——外部开发者可以在 FLA 库里看到它的实现、提 issue、甚至提交改进。
重新理解月之暗面的开源策略: 它不是"把权重丢出来让你自己玩"。它是分层开放——基础研究(Kimi-Linear)用最宽松的标准 MIT,应用级模型(K2/K3)用有限制的 Modified MIT,训练数据和训练流程保持私有。每一层的开放程度跟它的商业敏感度反相关。这是一个经过设计的策略,不是随机的。
月之暗面开放了不少东西——但你下载权重之后真的能跑起来吗?第四个说法关乎实际部署。
说法四:"7 月 27 日权重发布后就能本地跑"
核实结果:硬件到位也大概率跑不了。
硬件门槛的问题(8× A800/H800 起步、消费级卡完全不行)在 HuggingFace 文章里说过了,这里不重复。说一个很多人不知道的问题:推理工具链还没准备好。
K3 的注意力机制是 KDA with Attention Residuals(AttnRes),不是标准 Transformer attention,也不是 K2 系列用的 MLA。它需要专门的 CUDA kernel 来执行推理。
截至 7 月 17 日:
- llama.cpp:不支持 KDA
- Ollama:不支持
- LM Studio:不支持
- vLLM:部分支持(月之暗面向 FLA 库提交了 KDA kernel,但完整集成还在进行中)
这意味着你 7 月 27 日下载了 1.5 TB 的权重,装在 8 卡集群上——然后发现没有推理引擎能加载它。你需要等月之暗面随权重一起发布官方推理代码,或者等 vLLM/SGLang 完成适配。
K2.6 的经验是:权重发布后大约 2–4 周,社区推理工具链基本可用。照这个节奏推算,K3 的自部署在 8 月中下旬之前大概率无法生产可用。
给急着部署的人: 现在用 K3 API(kimi.com 免费、platform.moonshot.cn 付费),同时在集群上把 K2.6 跑通——确认你的推理流水线正常。7 月 27 日之后,先看 K3 仓库的 README 支持哪些推理框架。支持你在用的框架了再下载权重——别反过来。
前面四条核实的都是技术事实。最后一条不是技术问题——是动机问题。
说法五:"K3 开源是因为月之暗面大方"
核实结果:这是一个商业策略,不是慈善行为。
这条不是"错误"——而是误读了开源的动机。
开放权重对月之暗面有三个直接的商业好处:
第一:降低 API 获客成本。 开发者在本地试用了 K2.6,觉得好用,然后在生产环境用 K3 API——因为自部署 K3 的门槛太高(8 卡集群起步),大多数团队最终还是会选择 API。开放权重不是替代 API——它是 API 的前置漏斗。
第二:建立开发者生态。 社区做量化版本、写部署教程、开发适配工具——这些工作月之暗面不需要自己做,但它增加了 Kimi 系列的市场存在感和开发者黏性。K2.6 的 42 个社区量化版本和 146 万次下载就是这个效果。
第三:竞争压力。 DeepSeek V4 Pro 用标准 MIT 全面开源、GLM-5.2 也开放了权重——如果月之暗面不跟进,它在"国产开源大模型"这条赛道上会被边缘化。在中国 AI 社区,"不开源"几乎等于"不自信"。开放权重是维持竞争地位的必要动作。
把三家放在一起看更清楚:
| 维度 | K3(月之暗面,预期) | DeepSeek V4 Pro | GLM-5.2(智谱) |
|---|---|---|---|
| 许可证 | Modified MIT | 标准 MIT | 开放权重(具体条款见仓库) |
| 商用 | ✅ 允许 | ✅ 允许 | ✅ 允许 |
| MAU 门槛 | 有(K2.7 先例,具体数字待确认) | 无 | 无 |
| 合成数据限制 | 有(不受许可保护) | 无 | 无 |
| 训练数据公开 | ❌ | ❌ | ❌ |
| 训练代码公开 | ❌ | ❌ | ❌ |
三家都不公开训练数据和训练代码——这一点上没有区别。区别在许可证的附加条款:DeepSeek 用的是最干净的标准 MIT,月之暗面多了 MAU 和合成数据两个限制。对大多数中小团队不构成影响。对年 MAU 过亿的大规模部署——K3 和 DeepSeek 的许可成本差距是实质性的。
理解这个背景有什么用?它帮你预测 K3 开源之后月之暗面会做什么。它会持续优化 API(因为 API 是赚钱的业务),会在许可证上留出商业限制(MAU 门槛、合成数据条款),会让社区做量化和适配的脏活——但它不会公开训练数据和训练流程(这是核心竞争力)。
用一句话理解 K3 的开源定位: 月之暗面把 K3 的"使用权"开放了,但没有把 K3 的"制造方法"开放。你可以用它做任何事情——但你不能绕过月之暗面从零造出一个 K3。
那 K3 开源后你该做什么
不同身份,动作不一样:
| 你是谁 | 7 月 27 日该做的第一件事 |
|---|---|
| 独立开发者 | 什么都不做。继续用 API——自部署 K3 对个人来说既不现实也不划算。关注第三方推理平台(硅基流动、Together AI)上架 K3,它们通常比官方 API 便宜 |
| AI 创业团队 | 打开 LICENSE 文件,让法务看 MAU 门槛和合成数据条款。确认你的商业模式不会在 scale up 后踩雷 |
| 企业 IT 部门 | 评估许可证是否满足你的合规要求(注意:K3 是"开放权重"不是"开源")。如果有私有化部署需求——等推理工具链成熟后再动(8 月中下旬估计) |
| 学术研究者 | 先看 Kimi-Linear(标准 MIT、代码论文模型全公开)——它比 K3 权重本身对你的研究更有用。K3 的 KDA 注意力机制的参考实现在那里 |
| 要做 ToB 私有化交付的 | 查清楚 MAU 是怎么算的——你所有客户实例上的用户加在一起是否接近门槛。如果是——提前跟月之暗面沟通商业授权 |
常见问题
K3 是开源的吗?
K3 是"开放权重",不是 OSI 定义的"开源"。你可以下载权重、推理、微调、商用。但训练数据和训练代码不公开。对大多数应用场景不影响。对合规有 OSI 要求的项目是一个法律区别。
Modified MIT 和标准 MIT 有什么区别?
标准 MIT 只有四句话、零限制。Modified MIT 在此基础上增加了附加条款——K2 系列已知的包括 MAU 商业门槛和合成数据不受许可保护。K3 的具体条款以 7 月 27 日发布的 LICENSE 文件为准。
K3 和 DeepSeek V4 Pro 比,谁的许可证更宽松?
DeepSeek V4 Pro 用标准 MIT,无 MAU 门槛、无合成数据限制。K3 的 Modified MIT 多了这两个条款。对大多数中小团队影响不大,对月活过千万的大规模部署需要留意。
K3 的权重什么时候能下载?
7 月 27 日。在此之前 GitHub 和 HuggingFace 上都没有 K3 仓库。你可以先用 API(kimi.com 免费 / platform.moonshot.cn 付费)。
下载后能立刻部署吗?
大概率不能。K3 的 KDA 注意力机制在主流推理框架(llama.cpp、Ollama、LM Studio)上还未适配。vLLM 有部分支持。实际可用预计在权重发布后 2–4 周。
最后
"K3 开源了"——在网上看到这五个字的时候,你现在知道了它的五层真相:
它还没发布(7 月 27 日)。它不是"开源"是"开放权重"。它的许可证不是标准 MIT,有附加条款。下载了权重你大概率也跑不起来。月之暗面把它开放不是因为大方,是因为这在商业上说得通。
每一条都不影响 K3 是一个很强的模型——它在编程 Agent 和浏览器自动化上确实是全球第一。开放权重对整个行业来说是好事——更多竞争、更低价格、更多选择。
但你做决策的时候应该基于事实,不是基于标题。
7 月 27 日那天:先打开 LICENSE 文件,再打开 README,最后再决定下不下载。
作者
分类
更多文章

Fable 5 推翻雅可比猜想:87 年数学难题被 AI 反例终结
Claude Fable 5 协助数学家 Levent Alpöge 找到雅可比猜想反例,一个 216 字符的多项式映射推翻了存在 87 年的数学猜想。看 Fable 5 雅可比矩阵反例详解。
Nemotron 3 Ultra:专为长时 Agent 设计的 550B MoE 推理模型
Nemotron 3 Ultra 是什么?550B 参数、55B 活跃、Hybrid Mamba-Transformer、NVFP4、多 token 预测——这些技术参数到底意味着什么。本文从架构到场景,帮你快速判断它适合做什么、不适合做什么。
Wan 2.2 Remix v3 下载和上手:14B/5B 怎么选、文件名怎么看、ComfyUI 配置要点和排错
Wan 2.2 Remix v3 社区检查点超 10000 次下载,但大多数人第一次跑出来的结果完全不对。本文基于 300 轮测试,告诉你 Remix 和 I2V 到底有什么区别、14B 和 5B 怎么选、safetensors 文件名怎么看、以及 ComfyUI 配置的坑怎么绕开。
订阅简报
加入我们的社区
订阅我们的简报,获取最新动态与资讯