IT之家 7 月 6 日消息,今天,美團(tuán)將萬億參數(shù)大模型 LongCat-2.0 正式開源。摩爾線程隨后宣布,基于 AI 訓(xùn)推一體全功能 GPU 智算卡 MTT S5000 及 MUSA 軟件棧,已完成對該模型的快速適配。

據(jù)介紹,此次適配覆蓋模型加載、推理引擎拉起、關(guān)鍵算子優(yōu)化、部署驗(yàn)證與精度校驗(yàn)等全鏈路環(huán)節(jié),使 LongCat-2.0 能夠在 MTT S5000 上實(shí)現(xiàn)穩(wěn)定、高效的推理運(yùn)行。

作為美團(tuán)自研的新一代萬億參數(shù) MoE 大模型,LongCat-2.0 總參數(shù)量達(dá) 1.6T(平均激活約 48B,動態(tài)范圍 33B~56B)。該模型專為 Agentic Coding 場景設(shè)計(jì),原生支持 1M 超長上下文,并通過自研稀疏注意力機(jī)制(LSA)、ScMoE 跨層快捷連接架構(gòu)與零計(jì)算專家動態(tài)激活機(jī)制,實(shí)現(xiàn)了資源的高效利用與多任務(wù)協(xié)同。

摩爾線程技術(shù)團(tuán)隊(duì)依托 SGLang-MUSA 推理引擎及 MUSA 軟件生態(tài),圍繞 LongCat-2.0 的模型結(jié)構(gòu)和推理特性,快速完成從框架兼容到性能優(yōu)化的全鏈路適配。
硬件原生 FP8 加持,釋放長上下文推理性能
LongCat-2.0 面向更復(fù)雜的任務(wù)處理需求,在實(shí)際部署中往往涉及長輸入、多輪上下文、復(fù)雜指令分解和持續(xù)生成等推理負(fù)載,對 GPU 算力、顯存容量、訪存帶寬和推理調(diào)度能力均提出更高要求。MTT S5000 具備硬件級原生 FP8 加速能力,單卡具備高算力、大容量顯存與高帶寬,可為長上下文輸入、KV Cache 讀寫和高并發(fā)推理提供穩(wěn)定支撐。結(jié)合 SGLang-MUSA 推理引擎與 MUSA 軟件棧的協(xié)同優(yōu)化,LongCat-2.0 在 MTT S5000 上能夠更充分釋放推理性能,提升在線服務(wù)響應(yīng)效率與系統(tǒng)吞吐能力。
標(biāo)準(zhǔn)化工程路徑,縮短前沿模型部署周期
摩爾線程基于持續(xù)沉淀的模型適配經(jīng)驗(yàn),將模型結(jié)構(gòu)解析、權(quán)重加載、推理框架兼容、算子驗(yàn)證和部署測試形成標(biāo)準(zhǔn)化工程路徑,使 LongCat-2.0 能夠在 MTT S5000 上快速完成推理驗(yàn)證。這不僅進(jìn)一步體現(xiàn)了 MUSA 軟件棧對主流模型生態(tài)的高度兼容性,也有效降低了前沿模型在國產(chǎn)算力平臺上的遷移和部署門檻。
服務(wù) AI 應(yīng)用落地,支撐 Coding、Agent 與企業(yè)知識場景
圍繞 AI Coding、Agent 工作流、企業(yè)知識庫問答和長文檔分析等典型應(yīng)用,摩爾線程對 LongCat-2.0 推理鏈路進(jìn)行了部署級驗(yàn)證。通過框架、算子和調(diào)度層面的協(xié)同優(yōu)化,MTT S5000 能夠?yàn)榭蛻籼峁┘婢咝阅?、穩(wěn)定性和可擴(kuò)展性的推理基礎(chǔ)設(shè)施,助力大模型應(yīng)用更快從技術(shù)驗(yàn)證走向生產(chǎn)部署。
IT之家附 LongCat-2.0 官方開源地址:
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。