月之暗面开源Kimi K3大模型,2.8万亿参数刷新国产开源纪录

月之暗面公司于近日正式宣布开源其旗舰大语言模型Kimi K3,总参数量达到惊人的2.8万亿,这一参数量级不仅刷新了国产开源模型的最高纪录,在全球范围内也仅次于少数几个由美国科技巨头主导的闭源超大模型。Kimi K3采用了混合专家架构,将2.8万亿参数分布在64个专家子网络中,每次推理只激活其中约8个专家子网络,实际参与计算的活跃参数约为3500亿,这种设计在保证了模型巨大知识容量的同时,大幅降低了推理成本和响应延迟。根据官方公布的基准测试数据,Kimi K3在MMLU、HumanEval、GSM8K等国际权威评测中均达到了与GPT-4相当甚至部分超越的水平。

Kimi K3的开源策略在业界引起了较大反响。与此前许多大模型公司采取的API封闭服务模式不同,月之暗面选择了将完整模型权重、训练代码和数据处理管线全部开源的路线,开发者可以在遵守开源协议的前提下自由使用、微调和部署Kimi K3。这种策略的底层逻辑是,在通用大模型层面,技术领先的时间窗口正在急剧收窄,与其试图靠闭源维持短期优势,不如通过开源构建以自身技术为核心的开发者生态,从而在应用层和垂直行业解决方案上获取长期价值。从行业趋势来看,Meta的Llama系列和Mistral等开源模型的成功先例已经证明了这条路径的可行性。

从技术指标来看,Kimi K3在几个关键维度上展现了国产大模型的最新进展。在长文本理解方面,Kimi K3支持高达100万token的上下文窗口,这得益于月之暗面团队在注意力机制优化和位置编码方面的多项技术创新,包括自研的分层注意力压缩算法和动态位置编码方案。在多语言能力方面,Kimi K3在中文理解和生成任务上的表现显著优于同等规模的英文原生模型,这是因为其训练数据中高质量中文语料占比超过35%,且专门针对中文的语义特点做了数据清洗和增强处理。在代码生成能力方面,Kimi K3在HumanEval评测中的pass@1得分达到92.7%,接近GPT-4的93.1%,体现了其在实际工程应用中的强大潜力。

开源生态的建设对于月之暗面而言也意味着新的商业模式的探索。公司同步推出了基于Kimi K3的企业级部署服务和安全合规方案,为企业客户提供模型微调、私有化部署和持续运维的一站式服务,这一商业模式的本质是将开源模型作为流量入口,通过增值服务实现商业变现。目前已有超过50家企业宣布将基于Kimi K3构建自己的行业应用,覆盖金融、医疗、教育、法律等多个垂直领域,月之暗面由此从一家纯模型研发公司逐步转型为大模型生态平台。

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容