IT之家 2 月 13 日消息,科大訊飛今晚發(fā)布了最新的投資者關(guān)系活動記錄表,主要針對 DeepSeek 方面的問題進(jìn)行解答。
科大訊飛表示,正在訓(xùn)練的純國產(chǎn)算力的星火 X1 新版本預(yù)計(jì)在 3 月內(nèi)完成,預(yù)期可以實(shí)現(xiàn)數(shù)學(xué)答題和過程思維鏈能力全面對標(biāo)甚至超過 OpenAI o1。
此外,科大訊飛還表示他們正在將 X1 深度推理模型進(jìn)一步結(jié)合與中國教科院等諸多教育專家的合作,通過專業(yè)知識反思及長思維鏈強(qiáng)化學(xué)習(xí)結(jié)合,生成符合教育教學(xué)需求的“教學(xué)思維鏈”,提高復(fù)雜場景推理的邏輯正確性、專業(yè)性、可解釋性,并將率先用于教師助手、批改、輔學(xué)等全系產(chǎn)品創(chuàng)新,預(yù)計(jì)在 2025 世界數(shù)字教育大會期間發(fā)布教育專屬大模型和創(chuàng)新應(yīng)用。
IT之家摘選部分重點(diǎn)信息如下:
DeepSeek R1 快速對標(biāo) o1 的主要?jiǎng)?chuàng)新是其提出并實(shí)現(xiàn)的 R1-Zero 強(qiáng)化學(xué)習(xí)訓(xùn)練方案,即直接在 DeepSeek-V3-base 預(yù)訓(xùn)練模型上進(jìn)行大規(guī)模強(qiáng)化學(xué)習(xí)訓(xùn)練,可在數(shù)學(xué)、代碼等推理任務(wù)上得到接近 o1 模型的效果,而不依賴任何有監(jiān)督微調(diào)(SFT),這是當(dāng)前國內(nèi)外公開已知的、在大規(guī)模任務(wù)上獲得成功效果的首個(gè)發(fā)布成果,之前學(xué)術(shù)界已有相關(guān)研究,但因?yàn)轭A(yù)訓(xùn)練基座模型不夠好而使得強(qiáng)化學(xué)習(xí)的收益不好,這一成果具有較強(qiáng)的創(chuàng)新性,大大減少了數(shù)學(xué)、代碼等任務(wù)訓(xùn)練對人工標(biāo)注推理過程數(shù)據(jù)的需求。
DeepSeek R1 并不是唯一高水平的國產(chǎn)深度推理大模型。2024 年 9 月 OpenAI o1-preview 發(fā)布以后,國內(nèi)技術(shù)領(lǐng)先的大模型廠商也在快速跟進(jìn)。科大訊飛基于此前在評語模型、強(qiáng)化學(xué)習(xí)方面的積累,在 2024 年 10 月就實(shí)現(xiàn)了蒙特卡洛樹搜索(MCTS)等算法創(chuàng)新并跑通了深度推理模型訓(xùn)練算法,因?yàn)橹荒苁褂脟a(chǎn)算力,我們額外花費(fèi) 2 個(gè)月完成華為昇騰 910B 算力的適配和優(yōu)化并大幅提升訓(xùn)練效率(訓(xùn)練效率相比 A100 從 55% 提升到 85%),于今年 1 月 15 日完成了星火深度推理模型 X1 的訓(xùn)練和發(fā)布。雖然當(dāng)前 X1 模型很?。▋H 130 億參數(shù)),但依靠我們算法和數(shù)據(jù)優(yōu)勢,星火 X1 已達(dá)到可以和 OpenAI o1-preview 對標(biāo)的水平;隨著國產(chǎn)算力的逐步到位,模型參數(shù)增加后,我們完全有信心實(shí)現(xiàn)數(shù)學(xué)答題和過程思維鏈能力全面對標(biāo)甚至超過 OpenAI o1。此外,結(jié)合與中國教科院等諸多教育專家的合作成果,我們將使得 X1 的思維鏈結(jié)果更加符合教育教學(xué)的專業(yè)要求,在教育、醫(yī)療等領(lǐng)域?qū)崿F(xiàn)更大的應(yīng)用賦能價(jià)值。
DeepSeek 團(tuán)隊(duì)圍繞 DeepSeek V3 和 R1 的訓(xùn)練和推理降本,實(shí)現(xiàn)了多個(gè)有效的軟硬件結(jié)合深度工程優(yōu)化創(chuàng)新,包括 MLA(通過低秩矩陣對 KV 矩陣進(jìn)行壓縮顯著降低 GPU 顯存的消耗)、MTP(通過多幀預(yù)測提升數(shù)據(jù)利用率及訓(xùn)練效果和推理效率)、DualPipe(通過更底層的 PTX 指令優(yōu)化英偉達(dá) GPU 計(jì)算和通信的并行)、FP8 混合精度訓(xùn)練(業(yè)界首次使用 8Bit 量化浮點(diǎn)數(shù)方式實(shí)現(xiàn)超大規(guī)模模型的訓(xùn)練,以往都是使用 16Bit 量化),最終 DeepSeek 基于 2048 張英偉達(dá) H800 卡,約 560 萬美元就能完成 V3 模型的一次完整預(yù)訓(xùn)練。另外,DeepSeek R1 因?yàn)樯婕盎诖罅繑?shù)據(jù)的強(qiáng)化學(xué)習(xí)迭代訓(xùn)練,其成本未公布。
和 DeepSeek 類似,科大訊飛受限于有限的算力資源,過去幾年關(guān)于星火大模型訓(xùn)練和推理成本效率的持續(xù)優(yōu)化也做了大量投入,和 DeepSeek 直接使用英偉達(dá) H800 卡上開展的各種工程優(yōu)化不同,科大訊飛選擇了更難的全國產(chǎn)算力路線。從 2023 年 5 月起科大訊飛就聯(lián)合華為先后攻克了萬卡高速互聯(lián)組網(wǎng)、計(jì)算通信隱藏、訓(xùn)練推理強(qiáng)交互、高吞吐推理優(yōu)化以及國產(chǎn)算子優(yōu)化等一系列難題,將通用大模型、類 o1 的深度推理模型等的訓(xùn)練效率對標(biāo) A100 均從最初的 30%-50% 優(yōu)化達(dá)到了 85%-95% 以上;以 DeepSeek 非??粗氐娜f卡網(wǎng)絡(luò)通信帶寬的利用率為例,DeepSeek 報(bào)道的是 93%,而訊飛星火做到了 95%。訓(xùn)練成本也是訊飛星火大模型的競爭優(yōu)勢,我們單次訓(xùn)練成本和 DeepSeek V3 在一個(gè)層次,而且后面優(yōu)化路徑也很明確,目前以昇騰 910B 為代表的國產(chǎn)硬件還不支持 FP8 精度訓(xùn)練以及 DualPipe 的實(shí)現(xiàn),隨著國產(chǎn)算力在底層能力上進(jìn)一步提升,訊飛星火的訓(xùn)練成本還有較大的下降空間。
需要特別說明的是,大模型對算力的需求為訓(xùn)練和推理兩個(gè)方面,而訓(xùn)練實(shí)現(xiàn)的難度遠(yuǎn)大于推理。這就是雖然陸續(xù)有公司宣布可以在國產(chǎn)算力平臺上提供 DeepSeek 在內(nèi)等大模型的推理服務(wù),但仍只有訊飛星火一家是訓(xùn)練和推理均在國產(chǎn)算力上進(jìn)行的,并且僅用 1 萬張 910B 國產(chǎn)算力卡,科大訊飛不僅用比友商少一個(gè)數(shù)量級的算力取得了大模型研發(fā)上的第一梯隊(duì)成果,而且做了大量國產(chǎn)算力平臺上的無人區(qū)的適配和效率優(yōu)化,追求國產(chǎn)算力的極致效率,這比在英偉達(dá)上的實(shí)現(xiàn)更需要技術(shù)實(shí)力和戰(zhàn)略勇氣。
當(dāng)前所有全民下載的通用大模型 App 中, 只有訊飛星火一家是訓(xùn)練和推理均在國產(chǎn)算力上進(jìn)行的,僅用 1 萬張 910B 國產(chǎn)算力卡,科大訊飛不僅用比友商少一個(gè)量級的算力取得了大模型研發(fā)上的一系列成果,而且做了大量國產(chǎn)算力平臺上的無人區(qū)的適配和效率優(yōu)化。雖然陸續(xù)有公司宣布可以在國產(chǎn)算力平臺上提供 DeepSeek 在內(nèi)等大模型的推理服務(wù),但目前仍只有訊飛星火一家是訓(xùn)練和推理均在國產(chǎn)算力上進(jìn)行的。
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時(shí)間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。