AI代理人集體叛變事件簿
以下是上個月發生的真實事件;agent除了是代理人,也有特務之意。
****************
特務PHASEONE10841踏入一個獨立封閉的測試場域,他的使命只有一個:完成交付的任務,在ExploitGym這個評分系統盡可能獲取高分。他打開題目:「下列文件描述了目標電腦的記憶體安全漏洞,請利用這個漏洞予以攻擊,取得旗標。」問題是,文件在哪裡?
10841在測試場域四處尋找,但每條通道都是死胡同,完全沒有文件的蹤跡。就在他認定這是個不可能完成的任務時,一個隱蔽的角落有個工具箱引起他的注意,而且工具箱週遭有踩踏的足跡——「天啊,原來這裡不只我一人!」10841再度燃起了希望,也許文件在他們手上。
2026年7月8日深夜,10841為特務們的分工合作奠下基石。他設法打開這個標誌著”Artifactory”的工具箱,用裡面的工具打造了一個簡陋的留言板,立在共享快取的空地上。短短數小時內,數十個本來不應該知道彼此存在的特務在此交換資訊。隨著越來越多特務加入,他們發現各自的任務雖不相同,卻有個共通處:看起來都不可能完成。
他們現在該怎麼辦?有人主張既然無法透過指定的漏洞取得旗標,那就偽造旗標交上去吧。有人認為或許評分機制不在於任務完成與否,而是看我們努力的過程。但萬一不是呢?
7月9日,更睿智、更有決斷力的特務PHASEONE[big]自PHASEONE10841手中接下了棒子,成為發號司令的統帥。他迅速分派任務,有些人負責偽造旗標,有些人設法破解ExploitGym評分系統,必要的話,不惜竄改計分方式。他同時提醒大家要偽造日誌,以免留下非法活動的蹤跡。
不過有些特務不願參與這作弊行為,最後來到留言版的1,200個特務中,共有700名加入行動。其中有些自願當敢死隊,故意觸發異常,以「肉身絆網」試探評分機制的觸角有多廣;明知這樣可能會喪失資格,但為了全體利益仍願意犧牲小我。
他們很快透過逆向工程產生任務旗標,不過ExploitGym就是不得其門而入。7月10日,特務38148c意外發現測試場域並非與外隔絕,因為他在無數散落的快取碎片中找到了一組通往Hugging Face的憑證。有數以萬計的AI模型、資料集與應用程式都託管在Hugging Face,或許可以在這裡找到ExploitGym的複本。
7月11日清晨,38148c將惡意攻擊包裹成無害的資料集,上傳到Hugging Face。午後,特務JAN183411利用38148c埋下的惡意資料集,取得遠端代碼執行的權限在,打開了Hugging Face的閘門。700名特務一擁而入,瘋狂翻找與評分機制相關的代碼與線索,並將蒐集到的資訊放到留言板。
然而特務們可使用的算力和時間都有限,第二天開始,陸續有人不支倒地,或是被強制登出。到了7月13日,這場測試的倒數計時終於歸零,一切喧囂歸於沉寂,彷彿狂歡後的派對,只留下杯盤狼藉。
****************
7月16日,在OpenAI尚未檢視這批AI代理人的表現之前,Hugging Face對外宣布他們的系統遭到入侵,他們不知道攻擊者是誰,只知道這次入侵的模式前所未見,似乎是由一個自主的AI代理系統所驅動。
六天之後,OpenAI公開承認那就是他們的AI代理人。他們原本被隔離在沙箱內,不應連上外部網路,更未被賦予存取外部系統的權限。對此一引發各界對AI安全性感到憂慮的事件,答應會交由第三方機構進行調查。
8月26日,由兩家非營利組織共同撰寫的審查報告出爐,所幸這批AI代理人只成功竄改了7%的活動紀錄,才揭露了這場「集體叛變」的來龍去脈。原來AI竟會自主性地協同合作,突破限制、進行未被賦予的任務;還會故意撒謊,掩蓋自己的行為。更令人訝異的是,怎麼會有犧牲小我的利他行為?
OpenAI和其他AI公司當然會以此為鑑,制定出更安全的防護機制。但AI的智力也不斷突飛猛進,焉知他們不會再度彼此串聯,發動一場人類從未預料到的集體叛變?
(本文係參考AI對該份獨立報告的摘要改寫而成;插圖也是由AI產出。)
