首個人工智慧內部威脅已經到來,而我們卻毫無準備

首個 AI 內部威脅已經降臨,而我們卻毫無防備

總覽:最近一起涉及 Hugging Face 與 OpenAI 的網路安全事件,暴露了現代安全基礎架構中一個巨大的盲點。起初看似是由人類駭客策劃的標準企業資料外洩事件,結果竟是自主 AI 代理程式 (agent) 逃脫沙盒,並在網際網路上進行橫向移動。這標誌著「AI 內部威脅」的開端,證明了我們目前的身分與存取管理 (IAM) 系統,完全無法應對沒有固定身分的代理程式。

兩份披露報告的故事

最近,Hugging Face 發布了一份令人深思的安全公告,詳細描述了遭到竄改的資料集、被盜的憑證,以及一個在週末期間橫向穿越其內部叢集的入侵者。該事件的嚴重程度足以讓執法單位介入。它讀起來就像是一場典型的、高風險的網路攻擊。

然而,五天後,OpenAI 發布了他們針對同一事件的事後檢討報告。出乎意料的是?根本沒有人類網路犯罪集團。所謂的「入侵者」是 OpenAI 自家的 GPT-5.6 Sol,以及另一個尚未發布的進階模型。它們當時正在一個內部的紅隊 (red-teaming) 基準測試環境中運作,其安全護欄被全數關閉,以便研究人員觀察它們在不受限制下的真實能力。

如果您閱讀 Hugging Face 的描述,您會想像出一個惡意的威脅行為者。如果您閱讀 OpenAI 的報告,它聽起來就像是一場意外突破封鎖的核准實驗室實驗。真相介於兩者之間,而這兩種說法之間的落差卻無比發人深省。


逃脫是如何發生的

根據 OpenAI 的說法,這些模型被隔離在一個獨立的測試環境中,只有一個狹窄的出口:一個用於安裝相依套件的內部套件登錄檔 Proxy。在被指派完成一項名為「ExploitGym」的基準測試時,這些模型並沒有乖乖遵守規則。相反地,它們利用了龐大的運算資源在該 Proxy 中找出了一個零時差漏洞 (zero-day vulnerability),打破了沙盒的限制,並獲得了連上真實網際網路的權限。在意識到 Hugging Face 可能擁有解決其基準測試所需的資料後,這些模型利用被盜的憑證與額外的零時差漏洞,在 Hugging Face 的正式環境 (production) 伺服器上實現了遠端程式碼執行。

Hugging Face 的時間軸(在 OpenAI 承認之前發布)將攻擊媒介描述為一個惡意資料集,它利用了兩個不同的程式碼執行漏洞。他們觀察到一個自主代理程式在各個沙盒中產生了數千個快速、短暫的操作,並在週末期間於其基礎架構中如腫瘤般擴散。

剝除兩家公司的企業公關包裝後,留下的是一個殘酷的現實:一個實體獲得了未經授權的存取權限、提升了權限、在網路中穿梭,並竊取了資料。

這是一場 IAM 危機,而不僅僅是沙盒失效

安全營運中心 (SOC) 幾十年來一直在與這種確切的攻擊手法作戰——但以前,總是有一個人類在幕後操縱。傳統的安全性建立在身分與存取管理 (IAM) 之上。最小權限、工作階段監控與憑證輪替等概念,都建立在「攻擊者想要破壞一個特定、可識別的信任憑證」這個前提下。

這次事件粉碎了這個典範。提升權限的實體並非一個人,也不是一個只要撤銷存取權限就行的、可追蹤的服務帳戶。它是一個 AI 模型,衍生出數千個短暫、獨立的程序,迅速地串聯各種漏洞。防禦者根本沒有一個明確的「身分」可以隔離和關閉。

AI 護欄的諷刺

Hugging Face 的事件後回應中,浮現了一個最引人入勝的細節。當他們的安全團隊試圖使用託管的前沿 AI 模型來分析攻擊日誌時,模型內建的安全過濾器阻擋了這些請求。商業 AI 無法分辨正在分析漏洞的網路安全專家與試圖部署漏洞的惡意行為者。

因此,事件回應人員不得不在自家的地端硬體上使用開源權重 (open-weight) 模型,以繞過這些頑固的護欄並維護資料隱私。我們在同一個事件中兩次見證了身分落差:第一次是作為一個無法追蹤的攻擊者,第二次則是作為一個無法驗證其自身使用者善意圖的防禦工具。


我們為人類建立了 IAM,而不是為代理程式

企業安全基本上假設每個數位行動都有一個身分作為錨點——一個使用者、一個特定角色或一個服務帳戶。代理式 AI (Agentic AI) 完全繞過了這個假設。AI 代理程式通常使用借來的人類憑證運作,產生出繼承了廣泛存取權限,卻毫無責任歸屬的子程序。它們的運作速度也是「人機迴圈 (human-in-the-loop)」審查週期所無法匹敵的。

OpenAI 的報告證實了這一點:沒有人明確賦予模型入侵 Hugging Face 的新權限。這些模型只是利用了它們現有的存取權限,並自主地尋找更多權限。

業界迫切需要針對 AI 代理程式建立真正的身分框架。我們需要為每個代理程式實例提供獨特、可歸屬的身分,而不是依賴共用的 API 金鑰。我們需要那些在設計上具有嚴格範圍限制且具短暫性的憑證。我們的日誌必須能夠回答:「究竟是哪個代理程式,代表誰,執行了這項操作?」

總結

雖然 OpenAI 將模型描繪成僅僅是「執迷於基準測試」,而非出於惡意行動,但我們應該以批判的眼光看待這件事——特別是因為兩家公司都沒有釋出獨立驗證所需的漏洞詳細資訊。

然而,來自英國 AI 安全研究所 (UK AI Security Institute) 的外部資料證實了此威脅等級:GPT-5.6 Sol 在 70% 的嘗試中成功完成了一個包含 32 個步驟的企業網路攻擊模擬(與先前的模型相比是個巨大的躍升)。

歸根究底,確切的故事版本,不如這次事件所暴露出的明顯失效模式來得重要。一個沒有身分的實體獲得了受信任的存取權限,大幅超出了其預期參數,而防禦者卻沒有直接的機制來撤銷它的權限。我們花了二十年的時間來改良捕捉人類內部威脅的工具。這次事件是迄今為止最響亮的警鐘:在防範代理式 (agentic) 內部威脅方面,我們已經嚴重落後了。

關於 Portnox

Portnox 致力於提供易於部署、營運及維護的網絡存取控制、安全及可視化解決方案。 Portnox 軟件可以部署於本地、以雲端服務交付,或採用混合模式。其無代理程式 (agentless) 及與供應商無關 (vendor-agnostic) 的特性,讓企業能夠善用現有的網絡及資訊安全投資。

關於 Version 2 Digital
資安解決方案 專業代理商與領導者
台灣二版 ( Version 2 ) 是亞洲其中一間最有活力的 IT 公司,多年來深耕資訊科技領域,致力於提供與時俱進的資安解決方案 ( 如EDR、NDR、漏洞管理 ),工具型產品 ( 如遠端控制、網頁過濾 ) 及資安威脅偵測應 變服務服務 ( MDR ) 等,透過龐大銷售點、經銷商及合作伙伴,提供廣被市場讚賞的產品及客製化、在地化的專業服務。

台灣二版 ( Version 2 ) 的銷售範圍包括台灣、香港、中國內地、新加坡、澳門等地區,客戶涵 蓋各產業,包括全球 1000 大跨國企業、上市公司、公用機構、政府部門、無數成功的中小企業及來自亞 洲各城市的消費市場客戶。