IT之家 6 月 26 日消息,6 月 24 日,在 2026 MWC 上海展期間,華為與中國移動通信集團湖北有限公司(IT之家注:以下簡稱“湖北移動”)聯(lián)合宣布,雙方已成功完成全國運營商首個 AI 推理加速解決方案現(xiàn)網測試。
據介紹,該測試基于華為 OceanStor A800 存儲與昇騰 A3 超節(jié)點架構,搭載 UCM (Unified Cache Manager,推理記憶數(shù)據管理),在長序列 AI 推理場景下,實現(xiàn)了 Token 吞吐率最高可提升 372% 的突破性成果。
文章稱,隨著 AI 應用加速向 Agent(智能體)形態(tài)演進,長上下文序列(如代碼生成、多輪對話)已成為典型場景,但傳統(tǒng)算力卡高帶寬內存容量有限,嚴重制約了 KV Cache 的命中率。華為在 2025 年底重磅推出了 UCM 推理記憶數(shù)據管理技術,打破高帶寬內存和 DRAM 的容量限制,通過外置存儲提供 PB 級的 KV Cache,并對 KV Cache 進行全生命周期的分層管理與調度,不僅在單次對話時大幅擴展上下文窗口,還能在多輪對話中復用歷史 KV Cache,避免重復計算。
本次測試在湖北移動現(xiàn)網環(huán)境中部署 vLLM-Ascend 框架,針對 MiniMax M2.5、GLM-5.1 等主流大模型,模擬了 8K 至 190K 長序列輸入場景。測試結論如下:
MiniMax M2.5 模型場景下:啟用 UCM 后,首 Token 延遲(TTFT)優(yōu)化 26%~62%,單 NPU 卡 Token 輸出效率(TPS)有大幅提升。從不同序列長度分別來看,64K 的序列長度下 TPS 提升 58%,在 128K 序列環(huán)境下,TPS 提升 78%。
GLM-5.1 模型場景下:TTFT 優(yōu)化幅度達 51%~93%,TPS 提升 56%~372%。其中在 64K 序列長度下,TPS 提升 313%,在 128K 序列環(huán)境下,TPS 提升 372%。
華為表示,測試表明,隨著上下文長度增加,AI 推理加速方案優(yōu)勢持續(xù)放大,有效解決了長序列推理中的 KV Cache 容量瓶頸。
廣告聲明:文內含有的對外跳轉鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結果僅供參考,IT之家所有文章均包含本聲明。