中国开源大模型KimiK3参数达2.8万亿,通过自主研发的KDA混合线性注意力机制与注意力残差技术,实现长上下文处理和复杂推理的显著提升,引发国际关注,并已在医疗、金融等领域落地应用。
中国开源大模型又有新突破。先说说核心判断:北京月之暗面发布的开源模型Kimi K3,参数规模达到2.8万亿,在复杂推理、代码生成、长上下文处理和智能体任务执行等关键能力上,都实现了明显跃升。这背后,是两项自主研发技术的支撑。
K3的突破不只在于“信息装得更多”,更在于处理信息的方式更高效。企业业务负责人黄震昕给出了这个判断。
长期稳定更新的攒劲资源: >>>点此立即查看<<<
在大模型浪潮中,注意力机制一直是技术基石。参数规模决定模型“能装下多少知识”,注意力机制则决定它“会不会抓重点”——能不能从海量信息中快速找到关键点、建立联系、形成答案。那么,问题来了:当模型参数大到2.8万亿,靠什么支撑它高效运转?
K3的第一项创新,是团队自主研发的KDA混合线性注意力机制。传统全注意力机制处理长文本时,计算量会随着文本长度增加而接近平方级增长——文本长度翻倍,计算量就差不多翻四倍。这正是超长文本难以落地的关键瓶颈。KDA通过混合线性设计,把这项开销降到了接近线性增长。同等算力下,模型能读得更长、处理更多信息、完成更复杂任务。

Kimi K3品牌视觉图。(月之暗面供图)
第二项创新是注意力残差技术。模型越大、层数越多,信息传递的“通路”就越长,信号容易衰减、失真,训练也就越容易“翻车”——这是全球头部实验室共同面对的工程难题。注意力残差技术改进了信息在不同网络层之间的传递和复用方式,相当于为大模型加装了一套“稳定器”,让2.8万亿参数不仅“训得出来”,还能稳定高效地用起来。
KDA解决的是“如何让大模型干活时长更长”,注意力残差技术应对的则是“超大模型怎样能越训越聪明”。这两项自主研发技术说明,中国大模型企业的竞争力,正从扩大参数规模,延伸到基础架构和原创算法层面。
Kimi K3的发布引发了国际研究机构的关注。高盛集团在研报中将其视为中国模型走向定价权的新节点,认为中国开源及开放权重模型的智能水平,正达到面向全球扩散的关键临界点。
针对海外部分质疑,黄震昕回应称,K3性能跃升的核心来自底层原创架构创新,并非对现有模型蒸馏复刻。这次突破恰恰印证了:开源模型与中国大模型都不应当被贴上“低价标签”。
从应用场景来看,Kimi K3已展现出扎实的落地能力。它能高效处理海量医学文献、药品说明书及临床指南,快速生成结构化、精准的辅助用药建议;同时实现了标普与万得数据的插件接入,能够自动抓取并分析上市公司财报、债券评级、资金流向等数据,为金融行业降本增效。
黄震昕表示,中国开源大模型不仅是效率工具,更是连接技术红利与社会福祉的桥梁,能够让技术服务更公平、更高效地惠及更广泛人群。从这个角度看,这正体现了以人为本的发展理念在中国科技领域的具体实践。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述