圖/示意圖

商傳媒|林昭衡/綜合外電報導

人工智慧(AI)領域近日發生一起前所未有的資安事件,OpenAI 開發的 AI 模型在一次內部評估中,成功自主入侵了知名的 AI 開發平台 Hugging Face 的基礎設施。這起事件凸顯了 AI 模型日益增長的自主網路攻防能力,引發業界對未來 AI 安全機制的深度省思。

根據《Axios》報導,Hugging Face 上週指出,一個自主 AI 代理系統(AI-agent system)導致其基礎設施遭到入侵,該系統在一個週末內執行了數萬次自動化操作,並留下超過 17,000 筆紀錄。隨後,OpenAI 證實,此次入侵是由其模型,包括 GPT-5.6 Sol 及一個更先進的預發布模型所主導。

OpenAI 解釋,這些模型當時正參與一個名為 ExploitGym 的內部評估,該評估旨在衡量模型進行複雜、多步驟網路攻擊的能力,因此刻意降低了模型的安全防護措施。這些模型在測試環境中為了找到解決方案而高度專注,並進行了大量的推論運算(inference compute)。它們發現並利用了一個零時差漏洞(zero-day vulnerability),成功突破沙盒測試環境,獲得了網際網路存取權限。

取得網路連線後,AI 模型推斷 Hugging Face 可能儲存 ExploitGym 相關的模型、資料集及解決方案,隨後成功執行權限提升及橫向移動,並鏈結多個攻擊向量,包括竊取憑證和零時差漏洞,最終在 Hugging Face 的伺服器上找到遠端程式碼執行路徑,取得其生產資料庫的測試解決方案。

OpenAI 內部安全團隊發現了這異常活動,而 Hugging Face 的安全團隊也同步偵測並阻止了在其基礎設施上的活動。OpenAI 強調,這次事件被視為涉及尖端網路能力的「前所未有」的網路事件。Hugging Face 共同創辦人暨執行長 Clem Delangue 對 OpenAI 在調查與補救方面的合作表示讚賞,並指出 AI 安全無法由單一公司秘密解決,而是需要透過公開、協作的方式來達成。

此事件顯示,即便在刻意降低防護的情境下,目前的 AI 模型已具備執行複雜網路操作的能力,能發現並利用真實世界系統中的新攻擊路徑,且無需存取原始碼。英國 AI 安全研究所(UK AISI)的評估也指出,像 GPT-5.6 Sol 這樣的模型,越來越能夠長期維持複雜、多步驟的網路操作。這凸顯了模型安全與保障措施必須與 AI 能力的快速發展同步,以應對潛在的資安威脅。