Kimi K3 开源:2.8 万亿接入 Codex

摘要:7 月 27 日晚,月之暗面开放了 Kimi K3 模型权重——全球首个 3T 量级开源模型,2.8 万亿参数、MoE 架构、100 万 Token 上下文。权重放出不到 24 小时,vLLM、SGLang、OpenRouter 全部 Day-0 支持,Cursor 直接加入模型选择器。更重要的是,通过第三方工具可以将 K3 接入 Codex 客户端——这意味着不用美元订阅也能跑 OpenAI 的编程 Agent 了。

7 月 27 日晚上 11 点,月之暗面做了一件没人想到的事。

他们开放了 Kimi K3 的模型权重。2.8 万亿参数——全球第一个突破 3T 量级的开源模型。作为参照,第二名 DeepSeek V4 Pro 是 1.6T,GLM-5.2 是 744B。这已经不是领先一个身位的问题了。

但比参数更重要的是后续 24 小时发生的事情。

生态一夜之间接住了

权重放出后,推理框架 vLLM 和 SGLang 当天出了 Day-0 支持。月之暗面直接把 KDA(Kimi Delta Attention)注意力机制的实现合进了 vLLM 主线。

OpenRouter、Fireworks、Together——海外三个主流模型托管平台同一天上线 K3。价格统一:输入 3 美元/百万 Token,输出 15 美元/百万 Token。全部是 OpenAI 兼容接口。

然后 Cursor——这个被 SpaceX 以 600 亿美元收购的 AI IDE——也同一天把 K3 加进了模型选择器。不需要额外配置,下拉菜单里就能选。

一个开源模型,一夜之间被整个生态接住。这在之前没有发生过。

为什么 K3 会被生态接住

技术指标层面:K3 采用 MoE 架构,2.8 万亿总参数,每次推理只激活一部分专家,100 万 Token 原生上下文。在 Arena 的前端编程盲测中,开发者对它的偏好超过所有美国模型——包括 GPT-5.6 和 Claude Opus 4.8。

但这能解释 Cursor 在一个周末内就完成集成吗?

更合理的解释是市场因素。2026 年 6 月底,美国出口管制收紧,Anthropic 的 Fable 5 一度全球暂停访问。虽然一周多后恢复了,但这给全球的 AI 开发工具生态提了一个醒:如果你的整个工具链依赖单一国家的闭源模型,你是有供应风险的。K3 的开源、且不显著落后于闭源旗舰的编码能力,恰好踩中了这个时间窗口。

月之暗面的授权协议选得很聪明:MIT 衍生协议,个人和学术研究免费,商业使用在营收门槛以下免费。比 Meta 的 Llama 许可证更宽松,比 DeepSeek V4 Pro 的纯 MIT 紧一点但更清晰。这意味着绝大多数中小团队可以直接拿来商用,不需要签合同。

一个更接地气的事:K3 接 Codex

如果你在关注中文开发者社区,这几天讨论最多的不是参数规模,而是另一件事:怎么把 K3 接到 Codex 里用。

很多人没有美元信用卡,Codex 的订阅被挡在支付这一步。同时 K3 给的是 OpenAI 兼容的 Chat Completions API,而 Codex 走的是 Responses API——两个协议不互通。

解决方案是用一个本地的协议转换器。比较常用的叫 Teamo Router,流程大致是:下载 ChatGPT 桌面端(Codex 已整合进去)→ 在 Teamo 里选好 Codex 客户端 → 连接 TeamoRouter → 选 Kimi K3 模型 → 确认接入。全程不到 10 分钟,不需要配置文件,不需要信用卡。接入后 Codex 里面跑的已经是 K3 了。

实测 K3 在 Codex 下的编码响应速度大约 60-80 tok/s,生成中等复杂度的前端页面约 2 分钟。和 GPT-5.6 Sol 在 Codex 上的原生体验相比有明显体感差距(后者更流畅),但不至于不可用。如果日常编码任务主要是中小规模的功能实现,这个延迟在可接受范围内。

当然,这也有代价。转换器引入了一层中间代理,存在额外的延迟开销——大约 50-100ms。对于重度 Codex 用户来说,直接走官方 API 的体验更丝滑。但这个方案的意义不在于比官方快,而在于让被支付门槛挡住的人也能用上。

切换模型时有一个容易忽略的细节:Codex 需要完整退出再重新打开,否则旧配置缓存在进程里不会更新。macOS 上菜单栏退出算退出,只关窗口不算。

本地部署的残酷现实

说到这里,需要给"开源"这个词降降温。

K3 是开源的,不意味着你能在自己电脑上跑。它在 Hugging Face 和 ModelScope 上确实有完整的权重文件,但推理它的最低配置是 8 张 H100 80GB——640GB 显存,约 33 美元/小时在 RunPod 上租用。你可以在 AWS p5.48xlarge 上跑,98 美元/小时。

对于大多数个人开发者和中小团队,实际的选项只有两个:调官方 API(3/15 美元百万 Token),或者在 OpenRouter 上走第三方托管(稍贵一点但零配置)。自己搭基础设施只在月处理超过 15 亿 Token 时才有经济合理性。

"开源"在这里的意思是:你可审计它的权重、可基于它微调、不用担心它某天因为合规原因不可用。不是"免费"。

这一周意味着什么

从 7 月 23 日阿里开源 Qwen3-Coder 480B,到 7 月 27 日月之暗面开放 K3 权重,中间只隔了四天。两家国产模型在同一条赛道上做了同一个决定:把旗舰编程模型开源,然后看谁能接住最多的下游生态。

这是 2026 年 AI 编程工具领域的标志性状态转变。不再是一个月前的"国产模型追赶美国闭源"。当 Arena 开发者的盲测偏好超过所有美国模型,当 Cursor 把中国开源模型放进模型选择器,当 Codex 可以通过本地代理接上开源模型——"用哪个模型"从一个战略决策变成了一个运行时参数。

从 Qwen3-Coder 到 K3,这四天可能比很多人意识到的更重要。不是因为参数多,而是因为生态门槛被跨过了:一个开源模型,不需要特殊渠道,不需要美元信用卡,被全球最大的几款编程工具在 24 小时内接住——这是第一次。

作者:唐悦玮 | 从后端出发,用 AI 拓展到全栈的工程师。

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容