刚刚 Kimi K3 开源!2.8 万亿参数全面开放,海外开发者称其为 “本地版 Fable 5”

Wallstreetcn
2026.07.28 00:28

月之暗面开源 Kimi K3 模型权重、技术报告及关键 Infra 技术。该 2.8 万亿参数模型获海外开发者高度评价,被称为 “本地版 Fable 5”。多家海外 AI 厂商如 Nebius、Cognition 宣布适配或接入,华为昇腾亦实现原生支持,标志着开放模型性能的重大进步。

智东西 7 月 28 日报道,刚刚,月之暗面发布 Kimi K3 的模型权重、技术报告,并开源支撑 Kimi K3 模型训练的关键 Infra 技术MoonEP、FlashKDA 和 AgentEnv。

Hugging Face CEO Clem Delangue发文,Kimi K3 30 分钟内以超过 4000 个赞登顶趋势榜。迄今为止最快的发布增长速度

此前 7 月 17 日,月之暗面发布拥有 2.8 万亿参数的 Kimi K3,随即凭借出色的基准测试和实际体验被不少网友称作 “中国的 Fable 5 时刻”。

Kimi K3 开源后,北美 AI 基础设施创企 OsmanticAI 的创始人兼 CEO Ahmad发文,将 Kimi K3 称为 “本地版 Fable 5”,并 “强烈建议大家下载体验”,这样 “他们永远也夺不走我的 Fable 5” 了。

数字员工 Devin 开发主体、美国知名 AI 创企 Cognition 宣布,Kimi K3 现已接入 Devin 桌面客户端与命令行工具(CLI),并称:“在 FrontierCode 1.1 评测基准上,Kimi K3是我们测试过首款性能逼近前沿水准的开源模型。”

Nebius、Baseten、Fireworks 等海外 AI 基础设施厂商随即宣布Day 0 适配 Kimi K3。Nebius 称:“Kimi K3 是首个达到前沿性能水平的开放权重模型,是开放模型发展历程中的一大进步。”

华为昇腾 CANN 宣布对模型 MXFP4 量化实现 Day0 原生支持,并提供在昇腾 950PR/DT 系列和 Atlas A3 系列集群部署实践。同时,趋境科技宣布,基于开源大模型推理引擎 SGLang,完成了Kimi K3 在华为昇腾 910C 超节点上的 Day0 适配,并同步开源相关适配成果。

网友在 Kimi K3 上线前的讨论也非常火热。有网友发帖戏称,Hugging Face 甚至给 Kimi K3 做了个预热网页。

截至 Kimi K3 上线半小时前,已有近 3700 名开发者在等待上线。且在上线 10 分钟前,Kimi K3 的上线页面还短暂出现过 404 的情况。

模型权重地址:

https://huggingface.co/moonshotai/Kimi-K3

技术报告地址:

https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf

技术博客地址:

https://www.kimi.com/blog/kimi-k3

2.8 亿参数模型权重全面开放 三大关键 Infra 技术开源

Kimi K3 是一个拥有 2.8 万亿参数的混合专家(MoE)模型,具备原生视觉理解能力,并支持 100 万 token 的上下文窗口。

现在,每个人都可以下载并部署 Kimi K3 模型。无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用。

Kimi K3 此次还同步开源了训练系统,即 Infra 基础设施层的三项 Infra 技术:MoonEP、FlashKDA 和 AgentEnv。

三项开源 Infra 技术中,MoonEP 是为超大细粒度 MoE 设计的高性能通信库,让专家并行通信在不均衡情况下仍保持极致效率。

FlashKDA 是 Kimi Delta Attention 的高性能算子,在英伟达 H20 上 prefill 速度相比 flash-linear-attention 基线提升1.72-2.22 倍,可直接作为替换后端使用。

AgentEnv 是与 KVCache.ai 合作开发的沙箱系统,为大规模 Agent 训练提供高保真、强隔离的运行环境,支持快速快照、恢复和分叉,可应对大规模并行的 Agent 工作流。其中,FlashKDA 此前已开源,MoonEP 和 AgentEnv 随本次发布正式开源。

在模型架构方面,KDA+AttnRes 以 3:1 比例混合 KDA 与 Gated MLA,通过块级注意力残差增强跨层信息流动,实现高效长上下文建模

Stable LatentMoE 使每个 token 从 896 个路由专家中激活 16 个,通过 SiTU-GLU 与 Quantile Balancing 在极高稀疏度下保持训练稳定。

MoonViT-V2 视觉编码器从零开始使用 next-token prediction 训练,无需对比预训练,在达到基线效果的同时获得更稳定的优化过程。

后训练方面,模型在通用推理、通用 Agent 和编程 Agent 三大领域进行大规模任务合成,配合百万 token 上下文的强化学习基建,并完成了近 20 个内部评测集的完整评估。

多维评测:验证编程、Agent 与视觉能力全面提升

在官方公布的评测结果中,Kimi K3 在编程、Agent 任务和视觉理解等多个方向展现出较强能力。

在编程能力方面,Kimi K3 在超长时序持续开发 SWE Marathon、软件逆向 Program Bench、终端运维 Terminal Bench 2.1 等测试中表现突出。

其中,SWE Marathon、Program Bench 均取得第一,Terminal Bench 2.1 达到 88.3 分,与 GPT-5.6 Sol 接近;在高难度软件工程任务 FrontierSWE 中,Kimi K3 以 81.2 分位列第二,仅次于 Claude Fable 5。

在 Agent 和知识工作场景中,Kimi K3 同样展现出较强的任务执行能力。在网页深度调研 BrowseComp、办公自动化 Automation Bench、Excel 财务建模 SpreadsheetBench 2 等测试中取得领先,其中 BrowseComp 达到 91.2 分,Automation Bench 和 SpreadsheetBench 2 均排名第一。

不过,在综合白领任务 GDPval-AA v2、APEX-Agents 等更贴近真实办公流程的评测中,Kimi K3 仍弱于 Claude Fable 5 等顶级闭源模型。

在视觉能力方面,Kimi K3 在图表理解 CharXiv、文档分析 OmniDocBench 等任务中表现较强,其中 OmniDocBench 达到 91.1 分,超过参与对比的多款模型;但在部分视觉推理任务中,Kimi K3 仍存在差距,例如零样本视觉工具任务 Zerobench 低于 Claude Fable 5。

Kimi 内部也测试了 Kimi K3 的工程能力。在 GPU 内核优化测试中,Kimi K3 需自主完成代码分析、内核重写和性能验证,覆盖 AttnRes、KDA、MLA 等 GPU 计算任务。结果显示,在最高推理强度下,Kimi K3 表现接近 Claude Fable 5(含回退机制),并超过 Claude Opus 4.8、GPT-5.6 Sol 和 GPT-5.5。

在知识工作方面,Kimi 内部 Internal Knowledge Work Bench 测试显示,在统一开启最高深度思考模式后,Kimi K3 在通用推理、深度文档分析和金融专项三类任务中的表现均超过 GPT-5.5 和 Claude Opus 4.8。

Kimi K3 挑战复杂任务:生成游戏、设计芯片、分析科研数据

Kimi K3 发布后,智东西在 Kimi K3 Max 模式下实测了该模型的多模态与代码生成能力。在要求生成 3D 横版格斗游戏的测试中,提示词涉及 “被霸天虎入侵的破败城市地图”、“低多边形风格”、“5 种擎天柱阵营角色”、“5 种霸天虎变种敌人” 等复杂设定。Kimi K3 仅用一次就完成了游戏创建,没有出现错误。

海外开发者 @He1s_Sammy 在游戏设计场景下对比测试 Kimi K3、GPT-5.6 Sol、Fable 5 三款模型,向三者输入完全相同的提示词,围绕方案质量、游玩体验、调用成本综合评估。

测试结果显示,Kimi K3 的游戏设计表现最优,能够抓住玩法核心,产出内容节奏自然;而 Fable 5 与 GPT-5.6 Sol 生成的游戏节奏普遍过快。

在价格方面 Kimi K3:9.5/10,调用成本 0.030 美元(约合人民币 0.2 元)、Fable 5:7.5/10,调用成本 0.38 美元(约合人民币 2.57 元)、GPT-5.6 Sol:7/10,调用成本 0.11 美元(约合人民币 0.74 元)。

在官方展示的案例中,Kimi K3 展现了更长程的任务执行能力。在芯片设计方面,K3 基于开源 EDA 工具和 Nangate 45nm 工艺库,在 48 小时连续自主运行中独立完成了芯片的构建、优化与验证。

在科研领域,K3 一次分析了 391 个 GWTC-5 引力波事件,调用 20 多个并发子智能体,产出 7 张科学可视化图、2 张表格,并综合了 10 多篇论文的文献内容。

在 GPU 编程领域,它从零开发了类似 Triton 的编译器 MiniTriton,将开发者编写的程序转换为 GPU 可执行的代码,部分场景性能甚至超过现有工具。

结语:中国开源模型 正在进入全球开发者的工具箱

对于 Kimi K3,海外开发者的反应和半年前已经不太一样了。半年前,DeepSeek-V3 开源时,海外社区的讨论更多是 “又一个中国模型”。而到了 Kimi K3,话题变成了 “它比 Claude Opus 强”、“开发者正在把 Fable 换成 K3”。

影响力变大,也意味着被盯上的风险在变大。就在 Kimi K3 开源引发热议的同时,美国参议员蒂姆·斯科特和比尔·哈格蒂已提案扩大商务部权限以限制外国对手接触 AI 技术。美国商务部去年曾考虑将月之暗面、DeepSeek、阿里 Qwen 团队等中国 AI 实验室列入实体清单。白宫还曾考虑通过行政令,要求使用中国模型的美国企业对安全事件承担责任。OpenAI、Anthropic 等美国闭源 AI 企业曾提案禁用中国开源模型。

商务部回应称,这是 “典型的人工智能霸权主义行径”,并指出近 200 家美国初创企业敦促政府不要切断对中国开源模型的访问,认为这将削弱美国企业竞争力。

当美国企业自己都在用中国的开源模型,制裁的合理性自然站不住脚。AI 能力正在从少数公司的技术优势,变成全球开发者可以调用的基础工具——这个趋势不会因为一纸制裁令而改变。

风险提示及免责条款

市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。