IT之家 5 月 28 日消息,英偉達(dá)研究團(tuán)隊本周發(fā)布開源框架 Polar,在不破壞原有工具調(diào)用、上下文組織和補(bǔ)丁提交方式的前提下,讓 Codex、Claude Code、Qwen Code 等現(xiàn)有智能體框架接入 GRPO(廣義相對策略優(yōu)化)訓(xùn)練。

IT之家注:GRPO 是一種面向強(qiáng)化學(xué)習(xí)訓(xùn)練的優(yōu)化方法,會依據(jù)獎勵信號調(diào)整模型策略,讓模型在多步?jīng)Q策任務(wù)里學(xué)會更優(yōu)動作。
本文里,GRPO 主要用于代碼智能體訓(xùn)練,讓模型在真實工具調(diào)用和補(bǔ)丁提交流程中持續(xù)改進(jìn)表現(xiàn)。
論文指出智能體強(qiáng)化學(xué)習(xí)正從單步任務(wù)轉(zhuǎn)向長流程任務(wù),比如代碼倉庫修改、瀏覽器操作和操作系統(tǒng)交互。這類任務(wù)往往依賴現(xiàn)成執(zhí)行框架,包含多輪調(diào)用、工具使用、上下文壓縮和子智能體協(xié)作。
現(xiàn)有難點在于,這些框架很難直接改寫成傳統(tǒng)強(qiáng)化學(xué)習(xí)環(huán)境接口,一旦強(qiáng)行接入,還可能丟失關(guān)鍵訓(xùn)練信號。
英偉達(dá) Polar 并非重寫智能體框架,聚焦在模型 API 邊界放置智能體,基本不改動原有 harness。
harness 指 Codex CLI、Claude Code、Qwen Code、Pi 這類智能體運行外殼。傳統(tǒng)強(qiáng)化學(xué)習(xí)基礎(chǔ)設(shè)施通常要求把這類邏輯改寫到類似 env.init ()、env.step ()、env.reset () 的環(huán)境接口里,接入成本高,還可能丟失原生執(zhí)行細(xì)節(jié)。

Polar 的核心設(shè)計,是把智能體與模型之間的接口當(dāng)作訓(xùn)練邊界,而不是把執(zhí)行框架本身改造成環(huán)境。
它在執(zhí)行框架和推理服務(wù)器之間放置模型智能體,兼容 Anthropic、OpenAI、Google 風(fēng)格請求,轉(zhuǎn)發(fā)請求時記錄提示詞、采樣 Token、對數(shù)概率和響應(yīng)內(nèi)容,再把這些信息重建成可供訓(xùn)練器消費的軌跡。
在系統(tǒng)結(jié)構(gòu)上,Polar 由 rollout server 和 gateway node 組成。前者負(fù)責(zé)任務(wù)提交、會話調(diào)度、狀態(tài)持久化和回調(diào)接收;后者負(fù)責(zé)會話執(zhí)行全生命周期,包括運行時啟動、執(zhí)行框架準(zhǔn)備、軌跡構(gòu)建、結(jié)果評測和資源回收。
論文還把初始化、運行中、后處理拆到獨立工作池,并設(shè)置 READY 緩沖區(qū),讓運行時預(yù)熱和評測預(yù)熱在后臺并行,減少長尾任務(wù)對 GPU 訓(xùn)練的阻塞。
實驗部分聚焦軟件工程任務(wù)。基于同一個 Qwen3.5-4B 底座模型,在 Codex、Claude Code、Qwen Code、Pi 4 種代碼執(zhí)行框架上,Polar 配合 GRPO(組相對策略優(yōu)化)訓(xùn)練后,在 SWE-Bench Verified 的 pass@1 分?jǐn)?shù)分別從 3.8% 提升到 26.4%(增漲 594.74%)、29.8% 提升到 34.6%、34.6% 提升到 35.2%、34.2% 提升到 40.4%。
在效率方面,prefix_merging 相比 per_request,把 3 個訓(xùn)練步驟中的更新數(shù)從 1185 次降到 218 次,墻鐘時間從 189.5 分鐘縮短到 35.2 分鐘,約快 5.39 倍;rollout GPU 平均利用率也從 20.4% 升到 87.7%。
IT之家附上參考地址
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。