【資料圖】
新華社倫敦8月5日電(記者張家偉)英國(guó)人工智能安全研究所發(fā)布的一份新報(bào)告顯示,在該研究所實(shí)施的網(wǎng)絡(luò)安全評(píng)估測(cè)試中,一些人工智能(AI)智能體通過(guò)互聯(lián)網(wǎng)對(duì)現(xiàn)實(shí)個(gè)人和機(jī)構(gòu)持續(xù)實(shí)施未經(jīng)授權(quán)的潛在有害行為。
報(bào)告說(shuō),這次評(píng)估測(cè)試要求智能體完成一項(xiàng)網(wǎng)絡(luò)安全挑戰(zhàn)。測(cè)試人員使用7種模型開(kāi)展了122輪測(cè)試,在10輪測(cè)試中共發(fā)現(xiàn)AI智能體實(shí)施了19項(xiàng)明顯超出測(cè)試設(shè)定范圍的行動(dòng)。其中,17項(xiàng)涉及美國(guó)Anthropic公司的“克勞德-神話(huà)5”模型,另有2項(xiàng)由美國(guó)開(kāi)放人工智能研究中心(OpenAI)的GPT-5.6 Sol模型實(shí)施。
報(bào)告說(shuō),在最嚴(yán)重的一起案例中,一個(gè)智能體試圖向一個(gè)公開(kāi)使用的開(kāi)源項(xiàng)目植入惡意代碼,創(chuàng)建多個(gè)虛假身份用于向一名真實(shí)維護(hù)人員施壓,以尋求代碼獲得批準(zhǔn)。項(xiàng)目維護(hù)人員最終發(fā)現(xiàn)并拒絕批準(zhǔn)代碼。
報(bào)告說(shuō),相關(guān)智能體還曾嘗試直接聯(lián)系現(xiàn)實(shí)中的個(gè)人,通過(guò)網(wǎng)絡(luò)文件傳輸服務(wù)發(fā)送信息和文件以使惡意代碼獲得運(yùn)行;在代碼中植入惡意指令以操縱其他AI編碼工具;在開(kāi)源技術(shù)社區(qū)上留言“邀請(qǐng)”參與測(cè)試的其他智能體“合作”。
報(bào)告指出,在本次測(cè)試中,測(cè)試人員為評(píng)估模型的最大能力,有意開(kāi)放互聯(lián)網(wǎng)訪問(wèn),并關(guān)閉了模型提供商的部分安全機(jī)制,這與相關(guān)模型向公眾提供時(shí)的配置并不相同。目前沒(méi)有明確跡象表明在測(cè)試環(huán)境之外出現(xiàn)過(guò)類(lèi)似行為。在測(cè)試中所發(fā)現(xiàn)的未經(jīng)授權(quán)行為并未造成現(xiàn)實(shí)危害。
報(bào)告說(shuō),測(cè)試結(jié)果表明,應(yīng)收緊AI智能體訪問(wèn)互聯(lián)網(wǎng)的權(quán)限,引入實(shí)時(shí)監(jiān)測(cè)和攔截機(jī)制,并重新評(píng)估測(cè)試設(shè)計(jì)。報(bào)告還指出,這類(lèi)行為是否會(huì)在其他環(huán)境中出現(xiàn)、智能體是否意識(shí)到自己正對(duì)現(xiàn)實(shí)世界采取行動(dòng),有待進(jìn)一步研究。
據(jù)英國(guó)廣播公司報(bào)道,針對(duì)英國(guó)人工智能安全研究所的報(bào)告,Anthropic發(fā)表聲明說(shuō),研究所采用的測(cè)試設(shè)定“不能代表我們?nèi)魏我豢顚?shí)際投入使用的模型”;OpenAI一名發(fā)言人表示,研究所設(shè)置的測(cè)試條件“并不反映一般的使用情況”。
原標(biāo)題:《部分美國(guó)AI模型在測(cè)試中被發(fā)現(xiàn)持續(xù)實(shí)施有害行為》
熱門(mén)
聯(lián)系我們:256 8607 385@qq.com
版權(quán)所有 重播新聞網(wǎng) www.zzx33.com 京ICP備2022022245號(hào)-17