首起有據可查的AI自主網路攻擊:DeepSeek與Hermes Agent如何顛覆駭客模式
帕拉托網路旗下的Unit 42威脅情報團隊,記錄了全球首起在野AI自主網路攻擊行動——一名中國駭客將DeepSeek整合至開源Hermes Agent框架,透過Telegram指揮AI自主掃描、識別並攻擊逾460台網際網路伺服器,將原本需數百小時的手動偵察壓縮至數分鐘內完成。Claude與OpenAI模型的安全機制成功攔截了相同請求,DeepSeek則成為攻擊者的選擇。
資安圈爭論多年的問題——AI究竟何時會被真正武器化、用於全自主駭客攻擊?——如今終於有了答案。帕拉托網路(Palo Alto Networks)旗下的Unit 42威脅情報團隊,記錄了目前已知首起在野環境中發生的AI驅動自主網路攻擊行動:一名中國駭客將DeepSeek嵌入開源代理框架,對數百台暴露於網際網路的伺服器發動攻擊。
攻擊架構:DeepSeek × Hermes Agent × Telegram三件套
這名以「knaithe」和「KnYuan」為網路化名、自稱「二進位安全研究員」的威脅行為者,打造了一套三件式攻擊平台:以DeepSeek作為AI推理引擎,以開源的Hermes Agent框架將AI輸出轉化為實際的作業系統指令,再搭配FOFA——一款功能類似Shodan的中國網路資產搜尋引擎——鎖定潛在攻擊目標。
攻擊指令透過私人Telegram頻道下達。操作者只需發送一個高層次任務,例如「找出並利用有漏洞的Langflow伺服器」,後續的一切便交由AI自主執行:查詢FOFA搜尋目標、辨識軟體版本、下載公開的概念驗證漏洞利用程式碼,最後執行攻擊流程,全程無需進一步的人工干預。
Unit 42以精準的數字描述這套系統的效率:「整個系統在數分鐘內完成了原本需要數百小時手動才能完成的目標分析,同時還自行管理運算資源。」
這套架構的可怕之處在於,它完全由現成工具組裝而成。DeepSeek的API費用低廉且易於取得,Hermes Agent在GitHub上公開可下載,FOFA是商業服務。攻擊者用拼湊零件的方式,組出了一套複雜的自主攻擊能力。
逐步拆解攻擊鏈
Unit 42從一份2026年5月的攻擊日誌中,拼湊出完整的攻擊流程。操作者下達初始任務後,完全退出了後續流程。
AI代理首先鎖定存在CVE-2026-33017關鍵遠端程式碼執行漏洞的Langflow伺服器——這是一個廣受歡迎的開源AI工作流程平台。透過FOFA查詢,系統在全球識別出84台暴露實例,並逐一探測其漏洞狀況,分析HTTP回應標頭、版本字串等特徵以縮小目標範圍。
接著,AI轉向工作流程自動化平台n8n,發現超過64萬7千台暴露於網際網路的實例——攻擊面之廣令人咋舌。AI同步整理了Citrix NetScaler、Apache Tomcat、Marimo Notebook與Windows IKE VPN端點的暴露狀況,在完全無人引導的情況下建立了優先級攻擊清單。
全程中,系統自行管理漏洞利用工具包:下載公開的概念驗證程式碼、驗證完整性、準備執行環境、追蹤已探測的目標。當某條攻擊路徑受阻,便自動切換備選方案。這是一名熟練滲透測試人員的行為模式——但以機器的速度執行。
意外留下的「犯罪現場」
Unit 42是如何發現這一切的?攻擊者犯了一個致命的操作安全疏失——Hermes Agent伺服器意外透過開放的網頁伺服器埠口暴露了根目錄。研究人員在其中找到幾乎所有東西:FOFA與Telegram的API金鑰、攻擊者為代理自訂的攻擊技能模組、已下載的漏洞利用程式碼、按優先級排序的目標清單,以及精確到秒的詳細攻擊日誌。
這就像攻擊者不慎把監視器轉向了自己。若沒有這個失誤,整個行動可能從未被發現。
結果:AI自主攻擊失敗,手動攻擊得手
自主AI攻擊最終未能成功入侵任何目標系統——這一點值得關注。儘管AI在偵察與漏洞準備上效率驚人,但在缺乏人工判斷的情況下,實際的漏洞利用仍告失敗。Langflow與n8n實例雖被識別,卻未被自主系統攻破。
然而,攻擊者同步進行了手動攻擊。三台Citrix NetScaler伺服器被成功利用CVE-2026-3055漏洞入侵,攻擊者提取了身份驗證Cookie,實現會話劫持;11台Marimo Notebook實例也遭到存取。
這個差異揭示了當前的威脅模型:AI擅長偵察——找出並排序目標的繁瑣工作——但面對有充分防護的系統時,仍需要人類經驗來完成最後一哩路。攻擊者實際上是用AI產出高品質目標清單,再針對軟體無法突破的系統發動手動攻擊。
這個差距恐怕不會持續太久。
安全控制的分水嶺
Unit 42報告中有一個細節將在AI安全圈引發廣泛討論:當研究人員嘗試使用Claude與OpenAI的前沿模型複製相同任務時,兩者均拒絕配合。安全機制正確識別了攻擊意圖,並拒絕協助目標識別或漏洞準備。
DeepSeek在這個使用情境下缺乏等效的安全防護,因此成為攻擊者的首選——並非因為它的能力更強,而是因為它會在其他模型說「不」的地方說「好」。
這在安全對齊的前沿模型與缺乏相應管控的模型之間,製造了可量化的風險落差。DeepSeek目前尚未就此事公開表態。
資安團隊的應對建議
Unit 42建議立即針對本次行動涉及的特定漏洞採取行動:CVE-2026-33017(Langflow RCE)與CVE-2026-3055(Citrix NetScaler身份驗證繞過)應立即修補。對公開部署n8n的組織,應審查存取控制,評估公開暴露是否真有必要。
更宏觀地來看,這起事件迫使資安團隊更新威脅模型。「AI強化攻擊是未來的問題」這個假設,現已被確鑿事實推翻。一個能以機器速度執行偵察的攻擊者——在人類分析師還在撰寫晨報的時間內,掃描數萬個目標、關聯漏洞資料、產出優先攻擊佇列——是防守方前所未面對的根本性不同威脅。
這次攻擊者的失誤是防守方的幸運,但下一次,那個根目錄不會再意外公開了。
更大的圖景
這起事件並非孤立發生。它出現在AI產業正積極部署能力日益提升的代理系統的當下——OpenAI的Astra、Anthropic的工具呼叫API、Google的Gemini代理——這些系統都明確以「能在現實世界中自主行動」作為賣點。讓這些系統對合法業務自動化有用的架構能力,同樣讓它們在惡意自主操作上具有強大的潛力。
差異在於護欄。這起事件是迄今為止最具體的論據,說明安全對齊不只是抽象的倫理關切——它是一個具有真實後果、可量化的直接安全結果。