IT之家 7 月 3 日消息,英偉達(dá)昨日(7 月 2 日)發(fā)布博文,宣布推出 Nemotron-Labs-TwoTower,是一種基于預(yù)訓(xùn)練自回歸骨干網(wǎng)絡(luò)的離散擴(kuò)散語(yǔ)言模型,致力于解決大模型 Token 生成速度瓶頸。

在開(kāi)源方面,該模型以開(kāi)源權(quán)重形式在 Huggingface 平臺(tái)發(fā)布,授權(quán)協(xié)議為 NVIDIA Nemotron Open Model License。
參數(shù)方面,該模型總參數(shù)為 60B,采用雙塔(TwoTower)架構(gòu),包括 30B 的自回歸模型(AR)/context Tower 和 30B 的擴(kuò)散 / 降噪 Tower,每個(gè) Tower 激活 3B 模型,128 個(gè)可路由專家。
架構(gòu)方面,TwoTower 最大的亮點(diǎn),在于拆分傳統(tǒng)擴(kuò)散語(yǔ)言模型中的網(wǎng)絡(luò)任務(wù),將文本生成任務(wù)中的上下文表示與去噪過(guò)程分離到兩個(gè)獨(dú)立的神經(jīng)網(wǎng)絡(luò)“塔”中。
其中一個(gè)塔(上下文塔)保持凍結(jié),專注于維護(hù)文本的自回歸上下文;另一個(gè)塔(去噪器塔)經(jīng)過(guò)訓(xùn)練,負(fù)責(zé)對(duì)噪聲塊進(jìn)行去噪,兩個(gè)塔通過(guò)逐層交叉注意力連接協(xié)作。
性能方面,英偉達(dá)表示從綜合基準(zhǔn)測(cè)試質(zhì)量來(lái)看,雙塔架構(gòu)保留 98.7% 的質(zhì)量表現(xiàn),但是實(shí)際運(yùn)行時(shí)間吞吐量提高了 2.42 倍。IT之家附上相關(guān)測(cè)試結(jié)果如下:
| 任務(wù) | Nemotron-3-Nano-30B-A3B (AR) | Nemotron-Labs-TwoTower (diffusion) |
|---|---|---|
| MMLU (5-shot, acc) | 78.56 | 78.24 |
| MMLU-Pro (5-shot, CoT EM) | 62.59 | 60.93 |
| ARC-Challenge (25-shot, acc_norm) | 91.72 | 92.66 |
| WinoGrande (5-shot, acc) | 76.09 | 76.09 |
| RACE (0-shot, acc) | 88.90 | 88.90 |
| HumanEval (0-shot) | 79.27 | 75.58 |
| MBPP-Sanitized (3-shot) | 74.71 | 74.28 |
| GSM8K (8-shot, acc) | 92.49 | 90.14 |
| MATH-500 (4-shot) | 84.40 | 80.60 |
| MMLU Global Lite (5-shot) | 73.97 | 73.94 |
| MGSM (8-shot, avg acc) | 80.80 | 80.40 |
| Quality retained | 100% | 98.7% |
| Generation throughput (× AR) | 1.0× | 2.42× |
廣告聲明:文內(nèi)含有的對(duì)外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時(shí)間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。