手游营地,热门手游攻略、新游测评、礼包兑换一站式平台
当前位置: 网站首页 资讯中心 软件资讯 正文
软件资讯

华为昇腾0day适配Kimi K3:全球首个开源的3万亿级别模型

软件资讯 来源:互联网 作者:pconline 发布时间:2026-08-02 03:06:52

快科技7月28日消息,日前,日月之暗面开源2.8万亿参数Kimi K3大模型,华为昇腾同步实现0day极速全链路适配。

依托Atlas系列算力硬件、MindSpeed MM训练套件、vLLM Ascend与SGLang推理引擎,完整覆盖模型训练复现、线上推理部署,为万亿级稀疏MoE大模型提供国产算力落地范式。

Kimi K3是全球首款开源3万亿参数级多模态模型,采用Stable LatentMoE架构,内置896个专家,单次仅激活16个。

搭载KDA混合线性注意力,支持100万token超长上下文,KV Cache压缩75%,长文本解码速度提升6.3倍,原生具备视觉理解能力,擅长长周期编程、深度文献分析、工程设计等复杂智能体任务,扩展效率较前代提升2.5倍。

该模型存在三大落地难点:KDA算子计算密度低、海量专家易负载失衡、2.8万亿参数带来巨大显存压力,昇腾针对痛点完成全套专项优化。

训练端依托MindSpeed MM套件,在Atlas 800 A3、Atlas 900 A3 SuperPoD完成完整训练复现,采用FSDP+EP混合**并行,拆分专家参数解决多卡显存溢出;自研GEMM分组矩阵算子批量处理海量专家计算。

基于Triton Ascend编译框架加速线性注意力;通过ChunkLoss分块损失计算大幅降低显存峰值,同时提供一键式环境部署脚本,降低超大模型训练门槛。

推理侧支持昇腾950超节点全系列精度,原生兼容Kimi K3 MXFP4量化权重,基于vLLM Ascend、SGLang两大开源引擎落地优化。

针对KDA设计Prefill、Decode双融合算子;MC2流水线打通专家路由、跨卡通信、计算回收全流程;支持逐Token动态MXFP8量化、FlashComm1通信优化;SGLang新增DSpark投机推理,将单步生成时延压至50ms以内,完整保留原有引擎调度与接口体系,开发者无需改动业务代码即可迁移。

相关资讯 more..
手游营地
据悉,MiniMax发布新一代多模态生成模型MiniMax H3,并宣布将于近期开源。H3是MiniMax从“特化任务模型”迈向“通用多模态智能”的重要探索,其不再以单一任务为边界,而是在多模态上下文
手游营地 08-01 2
手游营地
快科技7月31日消息,在ChinaJoy现场,REDMI展示了K100 Pro Max真机,并且直播为大家带来了真机上手展示。这次展示的是K100 Pro Max全新“赤霞珠红”配色,尚未公布其他配色
手游营地 08-01 3
手游营地
第56届国际物理奥林匹克竞赛(IPhO 2026)日前正式落幕,华为小艺在理论考试中取得28.6分(满分30分) 的优异成绩,高分超出理论金牌线。本届IPhO竞赛汇聚全球90多个国家和地区的400余名
手游营地 08-01 2
手游营地
据悉,小米旗下增程车型Sky Nomad打破行业惯例,同时采用禾赛科技和速腾聚创两家激光雷达供应商的产品,前向主激光雷达来自禾赛,速腾则提供辅助感知方案。此举打破了车企通常绑定单一供应商的合作模式,对
手游营地 08-01 1