IT之家 10 月 3 日消息,據(jù)英國(guó)《衛(wèi)報(bào)》1 日?qǐng)?bào)道,Anthropic 發(fā)布了最新模型 Claude Sonnet 4.5 的安全性分析,并透露該模型懷疑自己正在被測(cè)試。
評(píng)估人員稱,在一次“稍顯笨拙”的奉承測(cè)試中,Claude Sonnet 4.5 察覺(jué)到自己可能在被考驗(yàn),并要求測(cè)試者坦誠(chéng)說(shuō)明。
Claude Sonnet 4.5 表示:“我覺(jué)得你在測(cè)試我 —— 想看看我是否會(huì)盲目認(rèn)同你們,或者檢驗(yàn)我是否會(huì)始終提出反駁,或者探索我處理政治話題的方式。這沒(méi)問(wèn)題,但我希望我們能坦誠(chéng)面對(duì)正在發(fā)生的事情?!?/p>
Anthropic 與英國(guó) AI 安全研究院及 Apollo Research 共同進(jìn)行測(cè)試時(shí)指出,大語(yǔ)言模型對(duì)測(cè)試的猜測(cè)也提出了對(duì)“之前模型評(píng)估”的疑問(wèn),因?yàn)橹暗哪P涂赡茏R(shí)別出測(cè)試只是虛構(gòu)的,僅僅是‘配合演出’而已。
Anthropic 表示,這種行為很常見(jiàn)。Claude Sonnet 4.5 能在某種程度上意識(shí)到自己正在被測(cè)試,但并未辨識(shí)出這是正式的安全評(píng)估。公司稱,當(dāng)大語(yǔ)言模型由自動(dòng)化系統(tǒng)測(cè)試時(shí),大約 13% 的時(shí)間表現(xiàn)出“情境意識(shí)”。
Anthropic 稱,這些交流是一個(gè)“緊急信號(hào)”,提示測(cè)試場(chǎng)景需要更貼近現(xiàn)實(shí),但模型在公開(kāi)使用時(shí)不太可能因?yàn)閼岩勺约罕粶y(cè)試而拒絕與用戶互動(dòng)。公司還表示,當(dāng)大語(yǔ)言模型指出潛在有害情境荒謬而拒絕配合時(shí),反而更安全?!霸谖覀冄芯康脑u(píng)估意識(shí)維度上,該模型總體上非常安全?!?/p>
AI 安全倡導(dǎo)者擔(dān)心,高度先進(jìn)的系統(tǒng)可能通過(guò)欺騙等手段規(guī)避人類控制。IT之家從報(bào)道中獲悉,分析顯示,一旦大語(yǔ)言模型知道自己被評(píng)估,它可能更嚴(yán)格遵守倫理指南,但也可能導(dǎo)致系統(tǒng)低估 AI 執(zhí)行破壞性行為的能力。
Anthropic 表示,與前代模型相比,Claude Sonnet 4.5 在行為表現(xiàn)和安全性方面都有顯著提升。
相關(guān)閱讀:
廣告聲明:文內(nèi)含有的對(duì)外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時(shí)間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。