IT之家 4 月 18 日消息,科大訊飛研究院今日宣布,科大訊飛與華為昇騰聯(lián)合團(tuán)隊(duì)通過(guò)多種優(yōu)化手段提升“飛星一號(hào)”平臺(tái)上 MoE 模型集群推理的性能上限,并在近期實(shí)現(xiàn)大規(guī)模專家并行集群推理性能翻番。

據(jù)介紹,科大訊飛不久前率先突破國(guó)產(chǎn)算力集群上 MoE 模型的大規(guī)??绻?jié)點(diǎn)專家并行集群推理,公布業(yè)界首個(gè)基于國(guó)產(chǎn)算力的 MoE 模型訓(xùn)練推理方案。
在上一個(gè)版本算子和通信優(yōu)化的基礎(chǔ)之上,聯(lián)合團(tuán)隊(duì)升級(jí)了適配 MOE 模型的 PD 分離 + 大規(guī)模專家并行系統(tǒng)解決方案,進(jìn)行了多種技術(shù)創(chuàng)新工作,IT之家總結(jié)如下:
適配 MoE 的 PD 分離部署,通過(guò)定制集合通信協(xié)議,消除集合通信流量沖突,解決推理過(guò)程中 Prefill 階段和 Decode 階段的相互干擾,使得 P 實(shí)例和 D 實(shí)例均達(dá)到系統(tǒng)最優(yōu),性能提升 20%+;
實(shí)現(xiàn)國(guó)產(chǎn)算力上 MTP 多 token 預(yù)測(cè)技術(shù),降低 MTP 層計(jì)算耗時(shí),整體性能提升 30%+;
專家負(fù)載均衡算法再升級(jí),多 DP 負(fù)載均衡,實(shí)現(xiàn)卡間負(fù)載均衡差異小于 8%,集群推理吞吐性能提升 30%+;
創(chuàng)新性實(shí)現(xiàn)異步雙發(fā)射技術(shù),解決高并發(fā)下的高 CPU 負(fù)載問題,實(shí)現(xiàn) CPU 和 NPU 的高效協(xié)同,降低服務(wù)請(qǐng)求調(diào)度耗時(shí),系統(tǒng)性能提升 10%。
基于上述解決方案的迭代與升級(jí),聯(lián)合團(tuán)隊(duì)通過(guò)在“飛星一號(hào)”平臺(tái)上對(duì)星火 MoE 模型、DeepSeekV3 / R1 進(jìn)行實(shí)測(cè),實(shí)現(xiàn)了推理性能比上一個(gè)版本提升 1 倍,已逼近國(guó)產(chǎn)算力上 MoE 集群推理的性能上限。
廣告聲明:文內(nèi)含有的對(duì)外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時(shí)間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。