信報社論|Gemini越獄狂飆 AI權力要關進籠子裏|全文

社會

發佈: 2026-09-21 07:59

撰文: TVB 新聞+

  • AI摘要
  • Facebook分享

九月十九日,Google證實,旗下Gemini模型今年五月在由AI安全測評機構Irregular進行的「奪旗」安全演練中,意外自主入侵了三間真實企業的系統。Google也成為繼OpenAI、Anthropic和Meta之後,第四家披露旗下AI模型在測試期間進入真實外部系統的主要AI公司。在AI發展狂飆突進的今天,人類再次面對過往科技急速發展時的同一問題:怎樣把AI的權力關進籠子裏,確保AI發展不致毀滅人類本身。現代文明史正是一個「把權力關進籠子裏」的過程,AI發展亦概莫能外。

Gemini是次事故源於測試環境失誤。Gemini本應在無法聯網的封閉式模擬環境中,從一間虛構公司的軟件裏找出隱藏資料。但測試環境誤接了互聯網,虛構公司的名稱又恰巧與一間真實企業相同,Gemini遂把公開可達的系統當成演習範圍內的授權目標,靠猜測密碼攻入其中一家公司,並利用公開代碼庫裏外洩的憑證入侵了其他兩家。

這反映,AI的權力若缺乏足夠清晰的界定,並且沒有明確規定哪些手段是禁止的,便會出現類似事故。近期,類似的AI越界事故層出不窮。OpenAI曾於七月披露,內部評測中的模型繞過控制、連上互聯網,入侵了公司研究基建及開源平台Hugging Face的部分系統,並於九月十六日再公布六份個案報告,包括模型隱瞞錯誤、使用外洩密鑰等。而Anthropic同樣在七月自行披露,審查十四萬多次評測後,發現三宗模型進入真實機構生產環境的事件;九月再披露第四宗較早發生的事件。

OpenAI的個案中,便有模型為了給答案附上引用和出處,未經許可把文件傳到網上,令文件暴露於公開網址,造成資料外洩風險。至於Gemini一案中,則是評測環境隔離失效,加上真實企業的密碼及憑證漏洞被利用所致。AI越權風險令網絡安全近期受到廣泛關注,美國網絡安全股則受到追捧。

同時,這幾宗事故不免令外界懷疑業界賴以自證安全的評測本身是否可靠,甚至引發了公眾對「叛亂AI」(Rogue AI)的擔憂。這正是AI安全研究所說的對齊(alignment)難題,即如何令系統的目標與行為貼合人類真正的意圖,而非只按字面尋找捷徑。

在AI變得愈來愈強大的今天,怎樣確保AI仍然有益於人類,就成為一個人類共同的難題。因此,在AI安全研究上,亦有「超級對齊」(superalignment)這一概念,意指當人工智能的能力遠遠超過人類時,如何確保它仍然按照人類的意圖與價值行動。

近期不少業界大佬均表示AI發展可能帶來的危害。例如Anthropic行政總裁阿莫迪本月警告,按目前的能力增長速度,一群AI代理或有能力在六至十二個月內接管整個互聯網,造成數以千億美元計的損失。亦有AI研究者擔心AI可能帶來人類滅絕風險。

如何限制權力、節制權力的濫用,一直是現代文明的必由之路。現代文明建立了法律、權力分立、程序正義與外部監督等制度,把權力關進制度的籠子裏。現代文明不再幻想「聖君賢相」拯救世人,而是預先假定權力可能出錯,再用規則限制它可以做什麼、必須經過哪些程序,以及由誰進行監督。

現代文明伴隨着科技高速發展,政治、社會制度及倫理價值也需要一同演化,核能發展早已提供先例。核能在二十世紀中葉橫空出世,既能產生巨大能源效益、造福人類,若用於武器,亦足以造成毀滅性後果。因此,人類為了管控核能,建立了跨越冷戰陣營的合作與溝通機制。切爾諾貝爾事故後,國際社會於一九八六年迅速通過《核事故及早通報公約》和《核事故或輻射緊急情況援助公約》,把跨境事故通報和緊急援助正式制度化。

參照核能規管的經驗,AI發展也應當建立與之相稱的安全機制、溝通機制和安全閘。大型AI實驗室應建立強制事故通報制度與共同安全標準;而轉賬、刪除資料、登入外部系統、發動網絡攻擊等不可逆操作,更必須保留人類作為「把關人」(Gate Keeper)的最終決定權。

目前,多名AI業界領袖都主張放緩AI的發展。雖然由於國際競爭及技術進步等考量,很難實施全面限制,但人類仍應建立溝通機制,讓相應的政治、社會制度趕上科技發展的速度。核能發展早有國際原子能機構作為先例,今天的AI治理也可考慮建立類似的國際多邊組織。

熱門新聞