Devin 集成 Kimi K3:开源编程模型首次在Agent平台逼近frontier
Devin 集成 Kimi K3:开源编程模型首次在 Agent 平台逼近 frontier
7 月 27 日,Cognition 旗下编程 Agent 平台 Devin 宣布接入月之暗面的 Kimi K3 模型。在 Devin 自研的 FrontierCode 1.1 基准测试中,Kimi K3 成为首个接近 frontier 水平的开源模型,得分超过 GPT-5.5,仅次于 Claude Opus 5、Claude Fable 5 和 GPT-5.6 Sol。
调试是强项,规格遵从是短板
Devin 团队在实测中发现,Kimi K3 在调试场景表现突出——它倾向于先运行代码、主动复现 bug,再动手修改文件,而不是靠猜测或模式匹配给出补丁。它还能熟练操作运行环境,自行启动所需服务并在完成后清理。
但在规格遵从(spec adherence)方面,Kimi K3 有时会出现偏离:当任务描述有明确规格要求时,它可能自行发挥,而这一点正是 GPT-5.6 Sol、Opus 5 和 Fable 5 的强项。这也意味着,如果你需要 Agent 严格按规格实现功能,Kimi K3 目前还不是最佳选择;但如果场景是排查和修复 bug,它的表现值得期待。
对开发者意味着什么
Kimi K3 现已在 Devin Desktop 和 Devin CLI 中可用,用户可以直接在模型选择器中切换使用。这是开源模型第一次在闭源编程 Agent 平台上达到接近顶级闭源模型的水平——此前,Devin 上的主力模型一直是 Claude 和 GPT 系列。
从成本角度看,开源模型在推理费用上有天然优势;从能力角度看,Kimi K3 在 FrontierCode 1.1 上的得分说明开源编程模型正在快速缩小与闭源 fronier 的差距。对日常使用 Devin 的开发者来说,多一个高性能开源模型选项意味着更灵活的成本-质量权衡。
Devin 近期密集接入新模型
7 月以来,Devin 的模型矩阵快速扩充:7 月 1 日上线 Claude Fable 5,7 月 9 日接入 GPT-5.6 系列,7 月 23 日加入 Claude Opus 5,现在又接入 Kimi K3。这种"全模型接入"策略让开发者在一个平台内自由选择最适合当前任务的模型,而不必在不同工具间切换。
值得注意的限制
Kimi K3 虽然综合得分亮眼,但规格遵从的短板意味着它更适合"探索-调试"类任务,而非"严格按需求文档实现"类任务。此外,Devin 本身是闭源商业产品,Kimi K3 的开源权重虽已公开,但在 Devin 内的使用仍受平台计费规则约束。
---
*来源:[Devin 官方博客](https://devin.ai/blog/kimi-k3)、[Devin Desktop 产品页](https://devin.ai/desktop/)、[FrontierCode 1.1](https://cognition.ai/frontiercode)*