华为AI推理加速现网测试成功:长序列吞吐量飙升372%

· 科技资讯
华为AI推理加速现网测试成功:长序列吞吐量飙升372%

现网实测,不是实验室数据

6月25日,华为与湖北移动联合宣布,双方已完成全国首个运营商级别的AI推理加速方案现网测试。测试数据令人振奋:在长序列Token场景下,吞吐率提升了372%。这意味着相同的硬件基础设施,AI服务的处理能力翻了近四倍——运营商的AI算力投资回报率将因此大幅改善。

与许多停留在实验室的理想环境测试不同,这次测试在湖北移动的真实运营网络中完成,涉及现网流量、真实用户请求和完整的网络协议栈。测试覆盖了从端侧设备到云端推理集群的端到端链路,验证结果对AI推理的规模化商用部署具有直接的工程参考价值。

三层技术方案解析

据华为披露,该方案核心包含三个层面的协同优化。第一层是网络层的智能路由与流量调度——通过自研的AI流量感知算法,将推理请求动态分配到当前负载最低、延迟最优的计算节点,网络层面的效率提升约40%。第二层是计算层的异构加速——基于昇腾AI处理器的算力集群配合华为自研的异构计算框架CANN,实现了计算与通信的深度流水线化,大幅减少GPU等待数据的空闲时间。第三层是算法层的智能KV Cache管理——针对长序列推理场景实现了动态压缩与高效复用,将显存占用降低了60%以上。

372%的吞吐提升不是单一技术点的成果,而是网络层、计算层、算法层三重优化的乘积效应。这也说明,在AI基础设施的优化上,”软硬协同”比单纯堆叠硬件更有效。

“长序列”为什么是核心痛点?

长序列处理是当前AI推理的第一大成本瓶颈。当用户与AI进行多轮深度对话、或让AI分析一份数百页的技术文档时,模型需要维护的KV Cache呈指数级增长。新一代模型如GPT-5.5的上下文窗口已扩展至百万Token级别,但对基础设施而言,上下文长度每翻一倍,计算和内存需求往往增加四倍以上。

华为的方案精准打击了这一痛点。372%的吞吐提升意味着,运营商可以在不增加硬件投入的前提下,支持更多用户同时使用AI服务,或为每位用户提供更长的上下文窗口和更低的首字延迟。

运营商AI化的加速信号

这一测试的另一层深意是运营商正在加速自身的”AI化”转型。湖北移动并非孤例——中国移动、中国电信、中国联通均已将AI算力网络列为2026年战略核心。当运营商从”流量管道”转型为”AI算力服务商”,整个产业链的基础设施层都将被重塑。

对于昇腾AI生态而言,此次全部基于国产芯片完成的现网测试,为昇腾在推理场景中的工程实用性提供了有力的数据背书。在美国对华芯片出口管制持续收紧的大背景下,国产AI芯片替代正在从”能用”向”好用”加速跨越。372%这个数字,让”好用”有了量化的注脚。

— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅