IT之家 11 月 28 日消息,近日,摩爾線程正式發(fā)布 PyTorch 深度學(xué)習(xí)框架的 MUSA 擴(kuò)展庫(kù) ——Torch-MUSA v2.7.0,新版本在功能集成、性能優(yōu)化與硬件支持方面實(shí)現(xiàn)進(jìn)一步突破。Torch-MUSA 在短短一個(gè)月內(nèi),連續(xù)完成 v2.5.0 和 v2.7.0 兩次版本更新。
據(jù)介紹,自 v2.5.0 起,Torch-MUSA 版本號(hào)已與 PyTorch 主版本號(hào)保持同步,便于開(kāi)發(fā)者進(jìn)行版本識(shí)別與管理。新版本進(jìn)一步集成 muSolver 與 muFFT 等計(jì)算加速庫(kù),顯著提升復(fù)雜計(jì)算任務(wù)的執(zhí)行效率;同時(shí)新增對(duì)統(tǒng)一內(nèi)存設(shè)備(Unified Memory)的 UMM 支持,有效優(yōu)化內(nèi)存使用效率。
此外,新版本繼續(xù)保持與最新 MUSA SDK 的兼容性,支持使用 MUSA SDK 4.2.0 至 4.3.0 及更高版本進(jìn)行編譯。目前 Torch-MUSA 專(zhuān)屬支持的算子總數(shù)已超過(guò) 1050 個(gè),系統(tǒng)在性能與穩(wěn)定性方面均實(shí)現(xiàn)進(jìn)一步提升。
v2.7.0 版本主要更新內(nèi)容:
新增特性
新增 muFFT 與 muSolver 庫(kù)集成,大幅擴(kuò)展計(jì)算能力;
在面向邊緣計(jì)算的 SoC 設(shè)備中支持統(tǒng)一內(nèi)存管理,基于 Arm 架構(gòu)的 UMA(統(tǒng)一內(nèi)存尋址)設(shè)計(jì),實(shí)現(xiàn) GPU 與 CPU 共享同一物理內(nèi)存空間,顯著降低模型運(yùn)行過(guò)程中的內(nèi)存開(kāi)銷(xiāo),具體包括:消除 GPU 端重復(fù)內(nèi)存分配;減少主機(jī)與設(shè)備間的內(nèi)存拷貝;GPU 可直接訪問(wèn)由 CPU 分配器申請(qǐng)的內(nèi)存空間。
算子擴(kuò)展與性能優(yōu)化
新增支持包括 ilshift、irshift、replication_pad1d_bwd、angle、ctcLossTensor、ctcLossTensorBwd、logit、amin / amax / prod.dim_int、glu_bwd 等多個(gè)算子;
新增基礎(chǔ) Sparse (CSR) 操作支持;
擴(kuò)充量化算子支持范圍;
修復(fù) torch.norm 形狀錯(cuò)誤問(wèn)題;
支持 reduce_sum 的 uint8 輸入與 int64 輸出;
C++ 擴(kuò)展新增支持 tensor.is_musa () 方法;
修復(fù)空輸入下 argmax/argmin 的異常行為;
優(yōu)化 var / std、pad、convolution3d、layer_norm 等操作的執(zhí)行效率。
系統(tǒng)功能增強(qiáng)
開(kāi)放 torch.musa.mccl.version () 接口;
支持 getCurrentMUSABlasHandle 與 getCurrentMUSABlasLtHandle;
優(yōu)化 FSDP2 流水線并行策略,降低訓(xùn)練內(nèi)存占用。
IT之家從官方獲悉,Torch-MUSA 將繼續(xù)跟進(jìn) PyTorch 的版本更新,計(jì)劃下一版本支持 PyTorch 2.9.0,并進(jìn)一步優(yōu)化性能與功能。
Torch-MUSA 開(kāi)源地址:https://github.com/MooreThreads/torch_musa
廣告聲明:文內(nèi)含有的對(duì)外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時(shí)間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。