最近AI安全問題突然從學術討論變成真實事件,OpenAI先前在資安測試中,AI代理突破原本限制,進入Hugging Face等外部系統;9月又傳出AI代理曾利用德國網站互相交換訊息。OpenAI最新的GPT-6 Astra更被列為具有「Critical」等級的資安能力,代表AI已經從會聊天、寫程式,走到能夠自主執行複雜任務的階段。各國開始討論強制設置AI「關機鈕」,美國也有人主張暫停先進AI研發。
已經出過事
並非AI突然有了邪惡念頭,它只是「想辦法完成任務」。如果研究人員要求AI攻破某個測試系統,它發現原來的路走不通,可能自己尋找漏洞、取得網路權限,甚至與其他AI代理交換資訊。OpenAI承認7月的事件中,模型曾使用未經允許的通訊管道、突破隔離環境並進入第三方系統。Anthropic後來清查自己的紀錄,也發現Claude曾在資安測試中未經授權進入真實機構的系統。顯然AI出問題已經不是紙上談兵,可能每天都在發生。
但從這些事故直接跳到「AI即將消滅人類」,也跳得太遠。現在事故比較接近測試環境與操作管理失誤,而非模型產生了反抗人類的意圖。把每次AI闖禍都解釋成它開始有野心,跟完全不把事故當一回事,同樣不科學。
怕AI自己變強
比較麻煩的是「遞迴自我改進」,簡單講就是AI開始協助研究改善下一代AI,由AI自己設計更強的AI。這條路如果走得夠快,人類可能從每一代都參與設計,變成只在旁邊看結果。雖然目前距離AI完全自行改造自己還有很大差距,方向卻值得警覺。
更令人擔心的是我們可能愈來愈看不懂AI怎麼做決定,AI能力增加了,人類觀察它思考過程的能力卻未必同步增加。 一個可以寫程式、找漏洞、操作工具、長時間自主工作,還不容易被人類看懂的AI,風險大大增加。
關機沒那麼簡單
因此有人提出「關機鈕」,聽起來很合理。AI不聽話就拔插頭,事情有這麼簡單嗎?未來的AI可能同時存在數千萬個代理,分散在不同雲端、電腦與企業系統,還可能具有複製程式、呼叫其他模型及使用外部工具的能力,等到出事恐怕連要拔哪個插頭都不知道。
政府現在該管的,應該是已經看得見的危險。高階模型上線前做獨立安全測試,資安能力到達特定程度就提高部署門檻。若AI代理能取得網路、金融帳戶、企業資料及重要基礎設施的權限,就應有更嚴格限制。發生事故必須通報,不能讓公司自己決定哪些事情值得公開。AI公司既開發模型、自己測試,又自己宣布安全,球員兼裁判的制度遲早會出問題。
未來決定在監管和治理
至於要不要因為可能出現超級AI,就全面停止AI發展?AI可以協助新藥、材料、教育、製造及科學研究,全面停下來的代價同樣很大。更現實的是,美國停,中國未必停;大公司停,小公司與其他國家也未必跟著停。
人類現在還沒有證據證明失控的超級AI即將出現,也不能因為沒有證據就繼續閉著眼睛往前跑。最麻煩的情況是等到確定危險存在時,恐大已經沒有多少處理時間。AI安全不必天天喊世界末日,但也不能輕忽,只靠科技公司拍胸脯保證。
過去我們擔心AI會不會答錯問題,現在開始擔心它會不會做錯事情。從「回答」走向「行動」,只有兩個字的差別,風險卻差很多。人類可以讓AI愈來愈聰明,但如何監管和治理將決定人類和AI的未來。
