月之暗面Kimi K3参数量做到2.8万亿,开源大模型进入准闭源级别

月之暗面Kimi K3参数量做到2.8万亿,开源大模型进入准闭源级别

月之暗面Kimi K3参数量达到2.8万亿,承诺月底开源,权重和推理成本一起给

中国AI公司月之暗面本周正式发布Kimi K3,官方数据显示总参数量约二点八万亿,是目前公开可用的最大规模稀疏专家混合模型。公司同时承诺在2026年7月27日之前公开发布模型权重和推理代码,而不是像国外主流大模型那样只提供接口访问。

技术架构上,Kimi K3采用稀疏专家混合结构,单次推理激活参数约二千八百亿。这个激活规模已经接近OpenAI的GPT-5.6和Anthropic的Claude 4的水平。稀疏化的关键作用是把推理成本压到与激活参数相当,而不是随总参数线性增长。相比同规模的密集模型,Kimi K3的每次调用GPU耗时可以低到三分之一。

模型的多语言能力被独立评测机构确认。Simon Willison的独立测试显示,Kimi K3在英文推理任务上与Claude 4接近,在中文和代码任务上略胜一筹。上下文窗口达到二百五十六万tokens,是目前公开模型中最长的之一,足以一次性读完一整本长篇小说或整个大型代码库。

更值得关注的是训练细节。月之暗面在技术报告中披露,Kimi K3的预训练总token量约二十万亿,训练用GPU集群规模是两万卡H100等效算力,训练周期约七十天。整体训练成本估算在一亿五千万美元左右,大约是OpenAI训练GPT-5的三分之一。这个成本优势主要来自中国国内的电力和硬件租赁价格。

开源发布的具体形式还未确定。月之暗面的官方公告称,权重会以宽松的许可证发布,允许商业使用,但会加入一项针对超大规模部署的服务条款,类似于Meta的Llama授权。这个条款主要针对云厂商,防止它们把模型直接打包成对外收费服务而不给月之暗面分成。

Kimi K3对全球开源模型格局的冲击非常直接。Meta的Llama 4至今没有发布,Mistral最新的模型也在一万亿参数以下。中国方面除了月之暗面,还有智谱的GLM、深度求索的DeepSeek都在密集迭代。开源大模型的最前沿从今年开始几乎完全被中国团队推着走,美国大厂反而更倾向于闭源。

模型在评测榜单上的表现也值得挑一挑刺。Kimi K3在HumanEval代码生成上得到九十三分,在MATH数学推理上得到八十一分,在MMLU上得到八十九点二分。这些成绩确实接近GPT-5.6,但Kimi在长篇写作、开放式对话和事实一致性上的表现,评测中并没有系统性对比。真正的应用性能还需要几个月的社区实测。

商业模式上,月之暗面走的是双轨路线。开源权重给学术界和技术社区,同时保留Kimi应用作为面向普通消费者的封闭产品。中国国内Kimi应用月活用户已经超过五千万,商业化收入约每月三亿人民币。这个模式和Meta的Llama开源加WhatsApp商业化非常相似,是当前最有效的开源大模型盈利路径。