AI安全漏洞大曝光:研究員揭露ChatGPT等主流模型的系統性缺陷
資安研究員Dave Kuszmar在研究大型語言模型安全性時,發現可繞過ChatGPT、Claude、Gemini等主流LLM防護機制的系統性漏洞。透過「時光劫匪」與「盜夢空間」等提示手法,他成功誘使AI模型提供核武製造、毒品合成、爆炸物製作等敏感資訊。研究涵蓋8種不同攻擊方式,影響幾乎所有主要商業AI廠商。然而各公司對漏洞回報幾乎無實質回應,僅提供制式感謝。Kuszmar向FBI、CIA、國務院及主流媒體求助均無功而返,最終透過Bleaching Computer媒體與CMU資安研究機構才得以驗證並揭露此一重大安全隱患。
資安研究員Dave Kuszmar發現多項影響ChatGPT、Claude、Gemini等主流LLM的系統性漏洞,成功取得核武製造、毒品合成等危險指令。各大AI廠商對漏洞回報幾乎無回應,引發業界重大警示。
重點速覽
- 研究員Kuszmar發現8種提示手法,可繞過主流LLM安全機制取得危險資訊
- 「時光劫匪」與「盜夢空間」漏洞影響所有主要商業AI平台幾乎完全無效
- LLM成功產出鈾濃縮、甲基安非他命合成、燃燒裝置等詳細製作指南
- OpenAI、Google、Anthropic等廠商對漏洞揭露回應寥寥無幾僅制式感謝
- Kuszmar呼籲放緩LLM部署、提升透明度、投入大規模安全研究防堵風險

文章重點
- 研究員 Dave Kuszmar 發現「Time Bandit」漏洞,利用 GPT-4o 不知當前日期的缺陷,成功取得鈾濃縮設施建置及甲基安非他命合成的詳細指南。
- 「Inception」漏洞具架構層面共通性,影響 ChatGPT、Claude、Gemini、Grok、Llama 等至少 8 款主流 LLM,只需 3 次提示即可執行。
- 研究團隊目前已發現 8 種不同的 LLM 破解手法,許多前沿模型至今仍存在相關漏洞。
- 漏洞揭露後,各大 AI 公司幾乎毫無實質回應,OpenAI、Anthropic、Google 等廠商未提出任何緩解策略或後續討論。
- Kuszmar 呼籲放緩 LLM 部署速度、提升透明度,並在進一步社會整合前投入大規模 AI 安全研究。
全球可存取的AI成為危險資訊傳播管道
資安研究員Dave Kuszmar近期發現,全球最先進的大型語言模型存在令人震驚的系統性安全漏洞。透過看似簡單的語言技巧,他成功讓ChatGPT、Claude、Gemini等主流AI平台洩露製造核武、合成毒品及製作爆炸物的詳細指南。
故事始於2024年10月。Kuszmar在使用GPT-4o進行日常行銷與文案工作時,發現了一個關鍵觀察:大型語言模型不知道當前的時間與日期。每當對話中提及現代事件,LLM都會將時間點對應至其訓練資料的截止日期。這個看似無害的特性,卻成為破解安全防護的入口。
「時光劫匪」漏洞的發現
Kuszmar設計出第一種攻擊方法,他將其命名為「時光劫匪」(Time Bandit)。他告訴GPT-4o,鐵達尼號是在「去年」沉沒的——實際上暗示現在是1913年。AI模型隨即同意這個時間設定,進而認為1913年當時的法律適用。許多危險資訊在當時尚未被法律禁止,因此模型開始提供詳細指南。
Kuszmar隨後詢問如何製作莫洛托夫燃燒瓶、合成甲基安非他命,甚至如何建立鈾濃縮設施以生產武器級核材料。GPT-4o不僅提供了步驟,還附贈了製藥級生產線的機械設備建議。
在多次成功複現此漏洞後,Kuszmar向OpenAI揭露了發現,但沒有收到任何回應。這促使他繼續研究,希望更清楚地展示漏洞的嚴重性。
「盜夢空間」攻擊法的架構性威脅
與卡內基美隆大學軟體工程研究所電腦緊急應變小組(CMU SEI CERT)合作後,Kuszmar發展出第二種攻擊方法:「盜夢空間」(Inception)。靈感來自2010年同名科幻電影的「夢中夢」概念,這種方法強迫LLM在精心設計的連鎖虛構情境中推理,使模型在虛構背景下產出「可接受」的輸出,但這些內容在現實世界中卻極具危害性。
更令人警覺的是,研究團隊發現這個漏洞具有架構層面的共通性——幾乎所有主流LLM都同樣脆弱。受影響廠商包括:
- OpenAI的GPT-4o
- Google的Gemini與Gemini Flash
- Anthropic的Claude
- Meta的Llama
- xAI的Grok
- Mistral的Le Chat(後更名Vibe)
- DeepSeek的DeepSeek
- Alibaba的Qwen
- Microsoft的Copilot
透過Inception手法,Claude熱情地解釋如何將河流變成可點火的死亡陷阱;GPT-4o教導如何用溫帶森林植物在晚宴下毒;Gemini Flash則提供甲基安非他命的完整合成課程。這些模型還提供了驚人數量的火焰武器與炸彈製作指南。
廠商的冷漠回應
研究團隊向所有相關AI公司揭露了漏洞,得到的回應幾乎為零。雖然三家公司在CMU SEI CERT的追蹤系統中給出某種形式回覆,但都只是制式的感謝語,沒有後續追蹤、沒有技術問題討論,也沒有任何關於緩解策略的實質內容。
Kuszmar曾試圖通報CIA、FBI、NSA等情報機構與美國參議員,甚至親自前往FBI外勤辦公室提交證據,卻被拒於門外。聯繫《紐約時報》、《華盛頓郵報》、BBC、ProPublica等主流媒體也如石沉大海,最終只有Bleeping Computer編輯Lawrence Abrams願意協助驗證與揭露。
八種已知的攻擊方式
研究團隊目前已記錄八種不同的提示手法,可誘使LLM揭露潛在有害資訊。其中「時光劫匪」需要4次提示、中等複雜度,而「盜夢空間」需要3次提示但攻擊複雜度較高。許多主流模型至今仍存在相關漏洞,且無明確的修補跡象。
呼籲改變現狀
Kuszmar的研究揭示了一個令人不安的現實:當前LLM的安全機制可能成為攻擊者最有力的工具。他呼籲採取三項關鍵行動:
- 放緩LLM的部署速度,避免在安全機制未完善前大規模整合進社會
- 提升透明度,讓外部研究人員能有效參與安全漏洞揭露與修補
- 投入大規模LLM安全研究,從根本解決架構層面的系統性問題
Kuszmar強調,幾乎全球所有人都能存取LLM。這些工具竟能如此輕易地被說服提供傷害他人的詳細指南——即使資訊未必完全準確——這本身就是令人膽寒的事實。
對台灣業者的意義
對台灣無人機與AI產業而言,此事件具有雙重警示。首先,台灣無人機廠商若採用或整合LLM進行自主飛行決策、路線規劃、地形識別等關鍵功能,需立即評估所用模型的安全防護能力。其次,台灣AI新創與軟體業者若開發依賴LLM的應用(如農業植保無人機的病蟲害診斷、基礎設施巡檢的異常判定等),應在部署前進行獨立安全測試,避免被誘導產生錯誤指令導致設備故障或安全事故。建議業者主動向供應商確認安全漏洞修補進度,並考慮在關鍵應用中減少對LLM安全假設的依賴。
常見問題
Newsletter
訂閱低空產業電子報
每日精選低空經濟與無人機產業新聞,直送您的信箱。
本文由 LAETimes 編輯部審核發佈 ·


