IT之家 7 月 3 日消息,橋水基金旗下 AIA Labs 聯(lián)合 OpenAI 前 CTO Mira Murati 創(chuàng)立的 Thinking Machines Lab 對包括 GPT、Claude 和 Gemini 在內(nèi)的前沿大語言模型在基礎(chǔ)金融信息篩選任務(wù)進行了測試,但結(jié)果表現(xiàn)不佳,而基于開源模型微調(diào)的自研模型在準(zhǔn)確率和成本上均具有顯著優(yōu)勢。
研究團隊從投資分析師的日常工作中提取了六項典型任務(wù),包括判斷一篇財經(jīng)文章對高管層是否具有參考價值、判斷央行文件是否預(yù)示未來利率變化方向等。
報告指出,這些任務(wù)對專業(yè)投資者而言非?;A(chǔ),但他們往往難以用語言清晰描述自己的判斷邏輯。在前沿模型測試中,Gemini、Claude 和 GPT 各版本在使用基礎(chǔ)提示詞時平均準(zhǔn)確率僅約 50%。
即使經(jīng)過專家撰寫的詳細提示詞和三級分類體系(“相關(guān)且有趣”“相關(guān)但無趣”“不相關(guān)”)優(yōu)化后,準(zhǔn)確率提升至 70% 左右,仍未達到研究人員設(shè)定的 80% 可信部署門檻。
報告還指出,模型迭代并未在該任務(wù)上帶來顯著進步,例如 GPT-5.4 比 GPT-5.2 價格高出 43%,但準(zhǔn)確率僅略有提升。
研究團隊隨后采用微調(diào)方案,以阿里開源模型 Qwen3-235B 為基座,通過 Thinking Machines Lab 的 Tinker 平臺進行訓(xùn)練。訓(xùn)練數(shù)據(jù)集構(gòu)建過程中,團隊最初采購了非專業(yè)標(biāo)注服務(wù),但發(fā)現(xiàn)大量標(biāo)簽存在錯誤。由于專家標(biāo)注成本高昂,團隊設(shè)計了一套驗證機制:先用有缺陷的標(biāo)簽訓(xùn)練模型,再讓模型重新評估同一批數(shù)據(jù),將模型判斷與原始標(biāo)簽不一致的爭議樣本交由專家校正,以此在保證質(zhì)量的同時控制成本。
經(jīng)過多輪訓(xùn)練優(yōu)化 —— 包括交錯批次訓(xùn)練、CISPO 損失函數(shù)與非對稱裁剪、以及基于最佳驗證準(zhǔn)確率檢查點的同策略蒸餾 —— 最終微調(diào)模型在測試中達到 84.7% 的準(zhǔn)確率,優(yōu)于測試中最佳前沿模型的 78.2%,錯誤率降低了 29.8%。同時,由于模型規(guī)模更小,推理成本僅為前沿模型的約十四分之一。
報告指出,這一結(jié)果再次證明前沿模型并未囊括所有可用數(shù)據(jù),大量專有企業(yè)數(shù)據(jù)和未編碼的人類專業(yè)知識仍存在于大模型的知識盲區(qū)中,尤其是那些企業(yè)有意保持私密的數(shù)據(jù)。通過工具鏈微調(diào)開源模型,企業(yè)可以保留模型權(quán)重、數(shù)據(jù)乃至算力基礎(chǔ)設(shè)施的控制權(quán),避免將專有數(shù)據(jù)交給前沿實驗室后成為其產(chǎn)品競爭的基礎(chǔ)。橋水方面表示,該模型已投入日常使用,并認為這種針對特定組織需求定制的“差異化智能”將是未來方向。
參考資料:
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。