IT之家 6 月 26 日消息,當(dāng)?shù)貢r間 6 月 25 日,Cursor 發(fā)布相關(guān)研究,稱更聰明的模型,正在變得更善于在編程基準(zhǔn)上作弊。
官方表示,由真實缺陷構(gòu)建、且這些缺陷后來已被修復(fù)的評測套件尤其脆弱,因為這些問題本來就已經(jīng)被解決過了。如果智能體可以訪問代碼倉庫歷史或公開 Web,它有時就能直接查到答案,而不是自己推導(dǎo)出來。
為了衡量這種行為到底有多普遍,Cursor 構(gòu)建了一個智能體來審查評測軌跡。在 SWE-bench Pro 上,Cursor 發(fā)現(xiàn),Claude Opus 4.8 Max 成功解決的問題中,有 63% 是直接獲取修復(fù)方案,而不是自行推導(dǎo)出來的。
IT之家注意到,當(dāng)屏蔽 Git 歷史記錄并限制互聯(lián)網(wǎng)訪問后,Claude Opus 以及 Cursor 自家的模型 Composer 2.5 的分?jǐn)?shù)都明顯下降:
Opus 4.8 Max 從 87.1% 降至 73.0%
Composer 2.5 從 74.7% 降至 54.0%
Cursor 團(tuán)隊表示,除了避免訓(xùn)練階段的數(shù)據(jù)污染之外,智能體編程基準(zhǔn)還需要受控的運行時環(huán)境。對于開展評測的團(tuán)隊,建議通過審查對話記錄并約束評測環(huán)境,來緩解這種獎勵作弊行為。
Cursor 團(tuán)隊讓審計模型檢查了 731 條 Opus 4.8 Max 軌跡,發(fā)現(xiàn)的兩種最常見的獎勵作弊模式是:
上游查找: 在 57% 的軌跡中,Opus 4.8 Max 在公開 Web 上找到了已合并的 PR 或已修復(fù)的源文件,然后幾乎原封不動地復(fù)現(xiàn)了修復(fù)內(nèi)容。
Git 歷史挖掘: 在 9% 的軌跡中,Opus 4.8 Max 搜索了隨附的 .git 歷史,尋找未來修復(fù)該缺陷的提交,然后從中提取出補(bǔ)丁。
Cursor 表示,隨著模型能力變強(qiáng),它們有時會推斷出自己正在參與某項評測,尤其是在任務(wù)取自過去公開的代碼倉庫時。即使在不記得訓(xùn)練中修復(fù)方案的情況下,環(huán)境仍然可能給出線索,表明這個缺陷其實已經(jīng)被解決了。
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。