手游营地,热门手游攻略、新游测评、礼包兑换一站式平台
当前位置: 网站首页 资讯中心 软件资讯 正文
软件资讯

全国运营商首个!华为联合湖北移动完成AI推理加速现网测试:Token吞吐率大增372%

软件资讯 来源:互联网 作者:pconline 发布时间:2026-08-02 06:27:27

快科技6月26日消息,据“华为数据存储”公众号消息,在2026 MWC上海展期间,华为与中国移动通信集团湖北有限公司(以下简称“湖北移动”)联合宣布,双方已成功完成全国运营商首个AI推理加速解决方案现网测试。

此次测试基于华为OceanStor A800存储与昇腾A3超节点架构,并搭载UCM(Unified Cache Manager,推理记忆数据管理)能力,在长序列AI推理场景下,实现Token吞吐率最高提升372%的突破性成果,为运营商智算业务的高效部署提供了重要技术支撑。

据介绍,本次测试在湖北移动现网环境中部署vLLM-Ascend框架,面向MiniMax M2.5、GLM-5.1等主流大模型,模拟了8K至190K长序列输入场景。

测试结果显示,在MiniMax M2.5模型场景下,启用UCM后,首Token延迟(TTFT)优化26%至62%,单NPU卡Token输出效率(TPS)也获得明显提升。

其中,在64K序列长度下,TPS提升58%;在128K序列长度下,TPS提升78%。

在GLM-5.1模型场景下,UCM带来的加速效果更加明显,TTFT优化幅度达到51%至93%,TPS提升56%至372%。

具体来看,在64K序列长度下,TPS提升313%;在128K序列环境下,TPS最高提升372%。

华为表示,测试结果表明,随着上下文长度不断增加,AI推理加速方案的优势将持续放大,有效解决了长序列推理中的KV Cache容量瓶颈。

对于运营商而言,这意味着在大模型推理、智能客服、内容生成、行业智能体等长序列AI业务场景中,现网智算资源有望获得更高利用效率,同时降低长上下文推理带来的性能压力。

相关资讯 more..
手游营地
据悉,MiniMax发布新一代多模态生成模型MiniMax H3,并宣布将于近期开源。H3是MiniMax从“特化任务模型”迈向“通用多模态智能”的重要探索,其不再以单一任务为边界,而是在多模态上下文
手游营地 08-01 2
手游营地
快科技7月31日消息,在ChinaJoy现场,REDMI展示了K100 Pro Max真机,并且直播为大家带来了真机上手展示。这次展示的是K100 Pro Max全新“赤霞珠红”配色,尚未公布其他配色
手游营地 08-01 3
手游营地
第56届国际物理奥林匹克竞赛(IPhO 2026)日前正式落幕,华为小艺在理论考试中取得28.6分(满分30分) 的优异成绩,高分超出理论金牌线。本届IPhO竞赛汇聚全球90多个国家和地区的400余名
手游营地 08-01 2
手游营地
据悉,小米旗下增程车型Sky Nomad打破行业惯例,同时采用禾赛科技和速腾聚创两家激光雷达供应商的产品,前向主激光雷达来自禾赛,速腾则提供辅助感知方案。此举打破了车企通常绑定单一供应商的合作模式,对
手游营地 08-01 1