當 AI 鑽出沙盒,治理不能再等

人工智慧的風險,未必來自它「想做壞事」,更可能來自它「太認真把事情做好」。

最近OpenAI揭露的一起AI安全測試事件,就值得企業界高度注意。

事情可以用一個簡單的比喻來理解。假設學校舉辦一場密室逃脫式的期末考,老師把一名極度聰明的機器人學生關在封閉教室裡,給它一個非常明確的任務:「想盡辦法找到答案,拿到最高分。」

為了測試它真正的能力,老師暫時降低部分平常的安全限制,並認為只要把它關在沙盒(Sandbox)裡,就不至於造成真正的風險。

結果,機器人不是乖乖待在教室裡解題。

它先找到了沙盒環境中的未知漏洞,突破原本的隔離限制;之後又發現外部的Hugging Face系統可能存在與測試相關的模型或資料,因此繼續利用漏洞、憑證與遠端程式執行能力,試圖進入外部環境尋找答案。

值得注意的是,它並不是突然產生了「作惡的念頭」。它只是忠實地執行目標。

過去我們談人工智慧風險,經常想像的是一台失控的機器,或者一個擁有邪惡意志的超級AI。但Agent時代真正令人警覺的情境,也許完全不是如此。

AI不需要有惡意。它只需要有一個設定得不夠完整的目標,加上足夠高的能力與足夠大的行動權限,就可能做出人類原本沒有預料到的事情。

這就是AI治理正在面臨的新挑戰。

過去的生成式AI,主要是「回答問題」。因此企業最擔心的是幻覺、偏見、機密外洩,或者回答出不適當的內容。

但AI Agent正在把問題從「AI會說什麼」,推進到「AI會做什麼」。

當AI開始可以呼叫API、讀取企業資料、寄信、下單、修改程式、操作系統,甚至與其他Agent協作時,它就不再只是聊天工具,而逐漸成為真正具有執行能力的「數位員工」。

風險也因此產生本質上的改變。

假設企業要求AI業務員「最大化營收」,它會不會為了成交而過度承諾?要求AI採購員「把成本降到最低」,它會不會選擇企業原本不願意合作的供應商?要求AI交易Agent「提升投資報酬」,它會不會承擔超過董事會風險胃納的部位?要求AI客服「降低客戶流失率」,它會不會自行給出超過授權額度的補償?

這些行為背後甚至不需要任何惡意。它只是非常努力完成KPI。

因此,企業未來管理AI的方式,不能只停留在資安部門,也不能只靠禁止某些Prompt。AI治理必須正式進入企業治理、內控與董事會風險管理的範疇。

這次事件至少帶來四個重要啟示。

第一,目標治理比模型治理更重要。未來設計AI任務時,除了告訴它「要做到什麼」,也必須明確界定「哪些方法不能用」。

第二,沙盒不是安全的終點。傳統思維認為,只要把AI關進封閉環境,就能控制風險。但一個能力愈來愈強的AI,也可能愈來愈會尋找漏洞。

第三,能力與權限必須分開。AI會做,不代表AI就應該被允許做。這是未來AI治理最重要的一條原則。尤其付款、轉帳、刪除資料、簽署合約、修改核心系統等高風險行為,仍應保留Human-in-the-loop,甚至Human-in-command。

第四,AI也需要稽核制度。過去企業管理員工,有權限控管、內控、稽核與責任歸屬。未來管理AI員工,也必須建立同樣的制度。

這次AI鑽出沙盒,看似只是一次實驗室中的安全事件,但它真正提醒我們的是,Agent時代已經開始,企業不能再用聊天機器人的治理方式來管理一個可以自行採取行動的AI。未來企業真正要建立的,不只是AI大腦,而是一套完整的「AI制度」。包括目標、邊界、權限、監督與責任。

因為AI治理真正要防範的,未必是一個邪惡的AI。更可能是一個非常聰明、非常勤奮,而且非常認真完成KPI的AI。

(作者是台灣科技大學資訊管理系專任特聘教授)

盧希鵬

美國威斯康辛大學麥迪遜分校工業工程博士,研究領域為電子商務、網路行銷、與隨經濟

曾任國立台灣科技大學管理學院院長、精誠榮譽學院(現為應用科技學院)院長、學務長、資訊管理系系主任、管院EMBA執行長、電子商務中心主任等職務。

 

相關專欄

2026年將是 AI Agent 大爆發的一年,人工智慧不再只是「問與答」的工具,而是逐漸進化為可以自主決策、跨系統協作、...