3 月 27 日,前阿里千問技術(shù)負(fù)責(zé)人林俊旸離職后發(fā)表長文,明確指出 AI 大模型的發(fā)展路線正在經(jīng)歷重大跨越,核心競爭焦點正從“推理型思考(Reasoning Thinking)”全面轉(zhuǎn)向“智能體思考(Agentic Thinking)”。

文章復(fù)盤了以 OpenAI o1 和 DeepSeek-R1 為代表的第一波推理模型浪潮,指出這標(biāo)志著行業(yè)從擴(kuò)大預(yù)訓(xùn)練規(guī)模,正式步入擴(kuò)大強(qiáng)化學(xué)習(xí)(RL)后訓(xùn)練規(guī)模的新階段,數(shù)學(xué)與代碼等可驗證領(lǐng)域成為優(yōu)化模型正確性的核心試金石。
林俊旸在文中深度剖析了行業(yè)內(nèi)嘗試“融合思考與指令模式”所面臨的落地困境。他透露,千問團(tuán)隊曾試圖通過 Qwen3 打造支持混合思考模式的系統(tǒng),但在實際推進(jìn)中發(fā)現(xiàn),指令模型追求極簡與低延遲,而思考模型需要消耗大量 Token 進(jìn)行復(fù)雜推演,兩者在數(shù)據(jù)分布和行為目標(biāo)上存在根本沖突。若數(shù)據(jù)篩選不當(dāng),強(qiáng)行融合往往會導(dǎo)致模型在兩端表現(xiàn)平庸?;谏虡I(yè)客戶對高吞吐量和低成本的真實需求,Qwen 在后續(xù)的 2507 版本中選擇推出了分離的 30B 和 235B 指令與思考變體。與之形成對比的是,Anthropic 和 DeepSeek 等廠商則繼續(xù)在統(tǒng)合推理與工具調(diào)用的混合架構(gòu)上進(jìn)行探索。
針對下一階段的技術(shù)演進(jìn),林俊旸斷言,單純延長模型內(nèi)部推理軌跡的時代即將過去,未來的主導(dǎo)將是在與環(huán)境交互中持續(xù)迭代計劃的智能體思考。他指出,智能體強(qiáng)化學(xué)習(xí)(Agentic RL)徹底改變了原有的技術(shù)棧要求,訓(xùn)練與推理必須實現(xiàn)更純粹的解耦。隨著大模型獲得搜索、代碼執(zhí)行等工具權(quán)限,防范獎勵作弊(Reward Hacking)將成為極其危險的挑戰(zhàn)。未來的行業(yè)護(hù)城河將不再局限于算法本身,而是轉(zhuǎn)移至高質(zhì)量環(huán)境設(shè)計、防作弊協(xié)議以及多智能體協(xié)同編排等系統(tǒng)工程能力上。
相關(guān)閱讀:
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。