IT之家 7 月 9 日消息,OpenAI 昨日(7 月 8 日)發(fā)布博文,挑戰(zhàn)行業(yè)權威評測基準 SWE-Bench Pro,認為在 731 個公開測試任務中,約 30% 存在評測缺陷。
IT之家注:SWE-Bench Pro 是由 Scale AI 推出的大語言模型與 AI 智能體編程能力評測基準,因高度貼近實際企業(yè)級開發(fā)且具備極高的防作弊標準,現(xiàn)已成為 AI 軟件工程領域的行業(yè)權威基準。
OpenAI 在博文中指出,在 731 個公開測試任務中,前沿模型在 8 個月內通過率從 23.3% 升至 80.3%,認為該基準已無法有效評估模型的軟件開發(fā)能力。

OpenAI 介紹稱,其數(shù)據(jù)點分析流程標記出 200 個失效任務,占全部 731 個公開任務的 27.4%;并行開展的人工標注活動識別出 249 個失效任務,占 34.1%。基于上述兩條審查路徑,OpenAI 預估 WE-Bench Pro 約 30% 的任務存在缺陷。
在問題類型方面,OpenAI 將其劃分為 4 類:
測試過嚴,把題面未寫明的實現(xiàn)方式也列為硬性要求
提示不充分,隱藏測試執(zhí)行未寫明、且無法合理推斷的要求
測試范圍過窄,不完整修復也可能通過。
提示具有誤導性,指向與測試要求不一致的行為
OpenAI 還披露一個典型問題,題面要求把內容轉為 Markdown 時,行首加入 1 個空格,但隱藏測試卻要求 2 個空格,導致模型按說明編寫代碼仍被判錯。

基于這次分析,OpenAI 撤回此前對 SWE-Bench Pro 的采用建議,并稱后續(xù)需要由資深軟件開發(fā)者專門為 AI 評測設計新的基準。
廣告聲明:文內含有的對外跳轉鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結果僅供參考,IT之家所有文章均包含本聲明。