
商傳媒|林昭衡/綜合外電報導
OpenAI 近日宣布,其人工智慧(AI)模型 Astra 已達到公司內部「預備框架」(Preparedness Framework)中最高級別的「關鍵(Critical)」網路安全能力門檻。這是 OpenAI 旗下首個達到此等認證的模型,意味著 Astra 能夠獨立發現過去未知的安全漏洞,並在無需人類逐步指導的情況下,於多種強化系統上成功建立功能性的零日漏洞(zero-day exploits),即指那些尚未被軟體開發者發現或修補的程式弱點。
根據 OpenAI 的定義,AI 模型若能獨立開發功能性零日漏洞,或能從高層次目標規劃並執行針對高難度目標的全面網路攻擊,即可獲「關鍵」等級。OpenAI 表示:「我們現在相信 Astra 符合我們預備框架中的關鍵網路安全能力門檻。這是我們首個達到此等級的模型,因此在開發和發布前需要更強大的安全措施。」該公司內部代號為 GPT-6 的 Astra 模型,在 ExploitBench 這項將已知軟體漏洞轉化為可執行漏洞的基準測試中,獲得了完美的 100 分。
Astra 實測展現高超入侵能力
在內部測試中,Astra 展現出其強大能力。面對近期 Google 瀏覽器 V8 引擎的漏洞,Astra 成功發現並串聯兩個先前未知的零日漏洞。同時,在一項涉及 V8 JavaScript 引擎漏洞的測試中,Astra 在任意程式碼執行率方面超越了舊有模型 GPT-5.6 Sol,且使用了更少的輸出 Token(模型處理資訊量的單位)。在針對強化瀏覽器和作業系統的實測中,Astra 能夠突破瀏覽器沙盒(一種隔離程式運行的安全機制),並在惡意 HTML 檔案開啟後於主機上執行指令。此外,Astra 還識別了強化作業系統中的多個漏洞,並將其串聯起來,成功從標準使用者帳戶提升至根(root)權限。
AI 代理加速勒索軟體攻擊
隨著 AI 駭客能力的提升,實際網路攻擊的風險也日益增加。網路安全研究組織 Unit 42 發布報告指出,有駭客已利用前沿的代理式人工智慧(AI agents,能自主規劃和執行任務的人工智慧系統)對企業網路執行勒索軟體攻擊。這次攻擊的每個步驟,包括偵察、入侵公共 API 端點、竊取憑證等,都由 AI agents 自動執行,其效率遠超人類操作者,將原本需要兩週的入侵時間大幅縮短。駭客甚至能劫持持續整合/持續交付(CI/CD)工作流程,竊取雲端存取金鑰,並利用受害者的雲端 AI 服務作為攻擊基礎設施,藉此隱藏其活動。
防禦與市場展望
儘管 Astra 展現出強大的攻擊能力,OpenAI 也強調其安全防護。內部測試顯示,Astra 拒絕了 91.5% 的網路越獄(cyber jailbreak)嘗試,即駭客試圖繞過模型內建安全防護,使其執行不被允許的惡意行為,這比 GPT-5.6 Sol 的 59% 有顯著提升。初期,Astra 的進階網路安全功能將僅提供給少數 Alpha 測試者,之後計劃透過 OpenAI 的 Daybreak Blue 計畫擴大應用於防禦性安全工作。網路安全公司派拓網路(Palo Alto Networks)建議,企業應部署自身的 AI agents 和自動化應對措施,以保護環境免受機器速度攻擊的威脅。
OpenAI 曾因 Astra 的網路安全和編程能力進展過快而暫停開發。據預測市場 Myriad 顯示,Astra 在 9 月 30 日前公開發布的機率曾高達 72%,但隨著更廣泛的推出計畫,目前該機率已降至 55%(預計 2026 年 11 月前)。同一時間,競爭對手 Anthropic 也發布了 Fable 5.1 和 Mythos 5.1 等模型,顯示 AI 領域的競爭依然激烈。



