Kimi K3:月之暗面发布 2.8 万亿参数开源多模态模型,首个 3T 级开放权重
7 月 17 日,月之暗面(Moonshot AI)正式发布 Kimi K3——目前参数量最大的开源模型。Kimi K3 拥有 2.8 万亿参数,采用 Mixture-of-Experts(MoE)架构,原生支持视觉理解,上下文窗口达 100 万 token。这是全球首个进入 3T 级别的开放权重模型,主要面向长程编程、知识工作和深度推理场景。
核心规格:2.8T 参数 + 新架构
Kimi K3 的总参数量达到 2.8 万亿,在 896 个专家中每次推理激活 16 个,配合 Stable LatentMoE 框架实现高效推理。模型引入了两项新的架构设计:
- Kimi Delta Attention(KDA):改善信息在长序列中的传递方式
- Attention Residuals(AttnRes):优化信息在模型深层之间的流动
月之暗面表示,这些结构性改进加上训练和数据配方的优化,使 K3 相比上一代 K2 的整体扩展效率提升了约 2.5 倍——即同等算力下能获得更好的智能表现。
K3 原生支持文本和图像输入,默认使用最大思考力度(max thinking effort)进行推理,后续版本将加入低/高努力模式切换。
编程能力:从 GPU 内核优化到编译器构建
Kimi K3 的编程能力是最突出的亮点之一。官方展示了几个实际案例:
GPU 内核优化:在相同沙箱环境中,K3 独立对 AttnRes、KDA 等 4 个内核任务进行性能优化,结果与 Claude Fable 5(含回退)表现相当,明显优于 GPT-5.6 Sol 和 Opus 4.8。
从零构建编译器:K3 自主开发了 MiniTriton——一个类似 Triton 的 GPU 编译器,包含自定义的 tile 级 IR 层、优化 pass 和 PTX 代码生成管线。在支持的 roofline 基准测试中,MiniTriton 的性能与 Triton 和 torch.compile 相当甚至更优,还能端到端驱动 nanoGPT 训练并保持稳定的收敛曲线。
视觉+编程混合任务:K3 可以结合 3D 推理、编程和视觉能力,将概念、图片或视频转化为可交互的游戏或应用——它通过"视觉闭环"不断在代码和实时截图之间迭代。
芯片设计:48 小时自主完成
一个令人印象深刻的案例是,K3 在一次 48 小时的自主运行中,使用开源 EDA 工具和 Nangate 45nm 工艺库,从零设计了一颗为其自身架构服务的芯片。这颗芯片在 4mm² 面积内集成了 146 万标准单元和 0.277MB SRAM,在 100MHz 下完成时序收敛,模拟解码吞吐量超过 8700 tokens/s。
与竞品对比
月之暗面对 K3 的定位很坦诚:整体性能仍落后于当前最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但在多项评测中超过了其他测试的模型。K3 的核心价值在于:它是目前最大的开放权重模型,开发者可以自由部署、微调和定制。
在 API 定价方面,Kimi K3 在 OpenRouter 上的价格为输入 $3/百万 token、输出 $15/百万 token。
如何获取
- 在线使用:Kimi.com、Kimi Work、Kimi Code
- API 调用:platform.kimi.ai
- 开放权重:完整模型权重将于 7 月 27 日发布
- 技术报告:架构、训练和评测的详细文档将随权重一同公开
Kimi K3 的发布标志着开源模型在参数规模上进入了一个新阶段。2.8 万亿参数的开放权重模型,配合原生多模态和百万 token 上下文,为需要本地部署和深度定制的开发者和企业提供了新的选择。