(来源:海光信息)
7月27日,月之暗面正式推出迄今能力最强的开源大模型Kimi K3。海光信息同步实现Day0极速适配,当日完成该模型在海光DCU平台的全流程适配、部署与性能验证,让国产算力用户无需等待、即刻体验这款3万亿级开源模型的满血性能。

Kimi K3是一个2.8万亿参数模型,基于KDA混合线性注意力机制(Kimi Delta Attention)与注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有100万token上下文窗口,是全球首个开源的3万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。
依托超大稀疏MoE架构,Kimi K3结合Stable LatentMoE框架,可在896个专家中高效激活16个;配合训练方法与数据配方优化,模型相比K2的整体扩展效率提升约2.5倍,能更有效地把算力转化为能力。在整套评测中,Kimi K3展现出前沿水平的能力,稳定超过其他所有开源模型。
凭借三重硬核能力,K3不仅能持续完成长时间工程任务、理解和处理大型代码库,还能一次性读入百万级超长上下文,并基于截图与视觉反馈实现真正的“视觉闭环“迭代。这对软件开发、科研计算、长文档处理等场景非常实用。
与模型权重同步公开的,还有Kimi K3 技术报告与三项关键Infra技术——MoonEP、FlashKDA和AgentEnv,覆盖从高性能通信、高性能算子到分布式RL环境的关键链路。
▍从算子到引擎全栈调优,海光DCU释放K3满血性能
围绕Kimi K3的架构特性,海光DCU团队依托自研DAS/DTK软件栈,完成了从底层算子、训练推理框架到推理引擎的全栈适配,带来部署与性能的双重升级:
●无缝迁移,开箱即用:Kimi K3在海光DCU上实现零改造部署——模型代码与业务逻辑均无需任何调整,开发者拿到算力即可上线,迁移成本几乎为零。
●架构级调优,性能满血:针对KDA混合线性注意力机制与896专家超大稀疏MoE架构,海光完成算子级定制优化。即便在百万级超长上下文的重载场景下,推理依然高效、稳定、低延迟,实测表现与GPU原生版本高度一致。
▍从写代码到造芯片:国产算力跑通K3前沿场景
满血落地的Kimi K3,把一批过去只存在于演示中的前沿智能场景,真正带到了国产算力之上: