IT之家 4 月 24 日消息,寒武紀(jì)今日宣布,已基于 vLLM 推理框架完成對(duì)深度求索公司最新開(kāi)源模型 285B DeepSeek-V4-flash 和 1.6T DeepSeek-V4-pro 的 Day 0 適配,模型發(fā)布當(dāng)日即可實(shí)現(xiàn)穩(wěn)定運(yùn)行,適配代碼已開(kāi)源到 GitHub 社區(qū)。
針對(duì) DeepSeek-V4 的新結(jié)構(gòu),寒武紀(jì)通過(guò)自研高性能融合算子庫(kù) Torch-MLU-Ops,對(duì) Compressor、mHC 等模塊進(jìn)行專(zhuān)項(xiàng)加速;利用 BangC 高性能編程語(yǔ)言,編寫(xiě)稀疏 / 壓縮 Attention、GroupGemm 等熱點(diǎn)算子的極致優(yōu)化 Kernel,充分釋放硬件底層性能。
在推理框架優(yōu)化層面,寒武紀(jì)在 vLLM 中全面支持 TP / PP / SP/DP/EP 5D 混合并行、通信計(jì)算并行、低精度量化以及 PD 分離部署等優(yōu)化技術(shù),通過(guò)策略優(yōu)化,在滿足延時(shí)約束下達(dá)到最佳的詞元吞吐能力,顯著提升端到端推理效率。
硬件特性同樣被深度挖掘:利用 MLU 訪存與排序加速能力,有效加速稀疏 Attention、Indexer 等結(jié)構(gòu);高互聯(lián)帶寬與低通信延時(shí),將 Prefill 和 Decode 兩種不同工作負(fù)載場(chǎng)景下的通信占比降至最低,最大化分布式推理的利用率。
IT之家注意到,今天上午,DeepSeek-V4 模型預(yù)覽版正式上線并同步開(kāi)源。DeepSeek-V4 擁有百萬(wàn)字超長(zhǎng)上下文,在 Agent 能力、世界知識(shí)和推理性能上均實(shí)現(xiàn)國(guó)內(nèi)與開(kāi)源領(lǐng)域的領(lǐng)先。即日起登錄官網(wǎng) chat.deepseek.com 或官方 App,即可與最新的 DeepSeek-V4 對(duì)話,探索 1M 超長(zhǎng)上下文記憶的全新體驗(yàn)。API 服務(wù)已同步更新,通過(guò)修改 model_name 為 deepseek-v4-pro 或 deepseek-v4-flash 即可調(diào)用。