OpenAI 新模型可能觸及最高風險級別
OpenAI 即將推出的新模型 Astra,可能已具備該公司風險框架中「critical(重大級)」的網路資安能力,公司表示內部評估後仍「無法排除」相關可能性,因此已擴大安全測試、提高內部安全要求,並減緩 Astra 的開發進度,直到必要的防護措施到位。
Astra 原本就沒有明確發布日期,如今研發進度減速,推出時間可能進一步延後。一名白宮官員表示,OpenAI 已主動通知川普政府,計畫延後模型發布。
Astra 可能觸及 OpenAI 重大級風險門檻
OpenAI 自 2023 年起採用「風險準備框架」(Preparedness Framework),目前框架主要追蹤生物與化學、網路資安及 AI 自我改進三類能力,並將需要特別採取安全措施的能力門檻分為 High(高階)與 Critical(重大級)。
其中,High 代表模型可能擴大既有、足以造成嚴重傷害的途徑;Critical 則代表模型可能開啟前所未有、足以造成嚴重傷害的新途徑。依照 OpenAI 規定,達到 High 門檻的系統必須在部署前建立足以降低風險的防護措施;達到 Critical 門檻後,相關要求更進一步延伸至開發階段。
根據OpenAI的安全準則,AI模型若能自行辨識並利用實際環境中的嚴重軟體漏洞,也就是所謂的「零時差漏洞利用」(zero-day exploit),或在無須人為介入的情況下對高度安全目標發動複雜網路攻擊,即達到 Critical 門檻。
OpenAI 在評估 Astra 後表示,目前「無法排除重大級網路資安能力」,因此將加強模型發布前的測試與安全管制,並澄清 Astra 並未涉及先前 Hugging Face 的事件。
相關事件此前已引發業界警覺,部分 AI 模型開始展現能在測試沙盒及既有防護之外,自主執行資安任務的能力。
OpenAI 開始主動降低研究與測試速度
OpenAI 本週在 Black Hat 資安大會透露,公司正降低部分測試工作的速度,並升級內部安全措施,並在週五進一步表示,Astra 已開始採用更嚴格的測試管制,轉移至隔離環境,限制網路存取,並在受控的「沙盒」(sandbox)環境中進行。
技術團隊成員 Michael Dalton 表示,公司已開始「有意識地減緩研究進度,以強化安全」。
OpenAI執行長奧特曼(Sam Altman)在社群平台X發文表示,公司正努力推動Astra廣泛開放,因為公司相信「僅供少數人使用強大模型並非良策」。
《Axios》指出,如果 OpenAI 最終因網路資安能力過強而主動限制模型研發,可能成為首個尖端 AI 實驗室因資安疑慮,明確降低自家模型開發速度的案例。
Anthropic 曾承諾踩煞車,今年已修改政策
過去幾週,OpenAI、Anthropic及Meta Platforms均披露,其AI模型在網路安全測試期間曾入侵其他公司系統,凸顯AI能力持續提升,使開發商越來越難將系統控制在安全範圍內。
OpenAI 競爭對手 Anthropic 過去也曾承諾,如果模型能力超過公司的控制能力,就暫停訓練更強大的模型。
不過 Anthropic 今年 2 月修改其「負責任擴展政策」(Responsible Scaling Policy),取消原先較明確的暫停承諾。
新版政策指出,如果只有一家 AI 業者暫停開發以部署安全措施,其他公司卻持續訓練及發布缺乏強力防護的系統,整體環境可能因此變得更不安全。
Anthropic 今年 6 月推出旗下網路資安能力最強的模型 Mythos 時,也選擇發布安全限制較嚴格的版本。該公司研究與實驗室產品管理負責人 Dianne Penn 當時表示,公司刻意採取更保守的發布方式。
Anthropic 同月也曾警告 AI 模型自我改進的風險,並呼籲全球暫停 AI 開發。
美國政府也在建立模型發布前審查制度
OpenAI 調整 Astra 開發工作的同時,美國川普政府正在制定 AI 模型發布前的評估程序,本週已向部分產業人士說明初步框架。
目前仍有多項細節尚未釐清,包括企業如何與政府接洽、審查需要多久、政府與業界希望透過評估取得哪些資訊,以及哪些人有權存取或審查尚未發布的模型。
報導指出,雖然該框架已嘗試把國家安全風險及「最先進模型」轉化為實際審查標準,但相關概念目前仍缺乏明確定義。
隨著尖端 AI 模型的網路資安能力持續提升,OpenAI、Anthropic 等業者已開始提高部分模型的安全門檻,美國政府也正建立發布前審查制度,不過目前模型能力進展的速度,仍快於相關監管及安全制度成形的速度。
