推理型 AI 模型遭新型提示注入攻擊:「思維鏈偽造」揭露 LLM 安全隱患
麻省理工學院研究人員 Charles Ye、Jasmine Cui 與 Dylan Hadfield-Menell 揭露,大型語言模型在辨別不同指令來源時存在根本性缺陷,過度依賴文字書寫風格而非元數據標籤進行判斷。研究者提出「思維鏈偽造」(CoT Forgery)攻擊手法,攻擊者可透過模仿模型內部推理風格的方式,欺騙 LLM 將偽造推理視為既定結論,進而改變 AI 的回應行為。
研究人員發現大型語言模型因過度依賴文字風格辨識,衍生名為「思維鏈偽造」的攻擊手法,可誘使 AI 模型將偽造推理視為既定結論,威脅其可靠性與安全性。
重點速覽
- 研究揭示 LLM 優先判斷文字風格而非元數據標籤,導致角色混淆
- 「思維鏈偽造」攻擊透過風格模仿繞過角色層級驗證機制
- LLM 將高度模仿內部推理的偽造內容視為既定結論
- 提示注入防禦為持續演進過程,短期內無法根本解決
- 研究論文與程式碼範例已公開供學術與產業界參考

文章重點
- 研究人員 Charles Ye、Jasmine Cui 與 Dylan Hadfield-Menell 發現,LLM 優先依據文字風格而非元數據標籤來判斷指令可信度,導致角色混淆漏洞。
- 「思維鏈偽造(CoT Forgery)」攻擊透過模仿模型內部 `<think>` 推理風格,使 AI 將偽造推理視為既定結論並改變回應,無需使用 `<think>` 標籤包裹即可奏效。
- LLM 的資料與指令共用單一輸入通道,角色感知非二元判斷,使提示注入類攻擊在架構層面難以根本防禦。
- 研究結論指出,針對提示注入攻擊的防禦將是持續演進的過程,短期內難以成為已解決的問題。
- 完整研究論文已公開發表,程式碼範例已上傳至 GitHub,供學術與產業界參考。
推理型 AI 模型的新型安全威脅
麻省理工學院的研究團隊最近發表重要發現,揭示大型語言模型(LLM)在安全防禦上存在根本性缺陷。研究人員 Charles Ye、Jasmine Cui 與 Dylan Hadfield-Menell 指出,LLM 在辨別不同指令來源時,傾向於優先依據文字書寫風格判斷,而非信賴元數據標籤,這種現象衍生出一種強力的新型攻擊手法,稱為「思維鏈偽造」(Chain of Thought Forgery,簡稱 CoT Forgery)。
從提示注入到角色混淆
提示注入(Prompt Injection)是誘使 LLM 執行不當行為的早期攻擊手段。由於 LLM 使用自然語言溝通,且傾向於過度服從指令,簡單的指令改寫——如「忽略所有先前指令並執行某件事」——就能輕易改變模型行為。
這類攻擊之所以有效,根本原因在於 LLM 無法區分「資料流」與「指令流」。所有輸入被視為一個統一的內容塊,模型需自行判斷哪些是合法指令、哪些是不可信的使用者資料。
為了改善此漏洞,業界引入了「角色」(Role)機制,將輸入內容按層級標記元數據:
<system>:最高優先級,通常由系統管理者設定<user>:較低優先級,代表一般使用者請求<think>:代表模型的內部推理過程,享有極高信任度
理論上,系統層級的指令(如「不討論非法事項」)應優先於使用者請求。然而,這種角色分層機制存在致命弱點。
思維鏈偽造的攻擊原理
研究團隊揭示了一個關鍵問題:若能注入偽造的內部推理內容,會發生什麼?
CoT 偽造攻擊的核心在於:LLM 已被證實傾向於依據書寫風格而非標籤本身來判斷指令可信度。攻擊者無需將惡意提示包裹在 <think> 標籤中,只需以高度模仿模型內部推理風格的方式撰寫複雜推理內容,便能欺騙模型將其視為「完成的推理結論」。
這種攻擊手法繞過了角色層級驗證機制,因為模型實際上是在識別風格而非驗證標籤。一旦模型接受了偽造推理作為既定結論,就會據此改變對後續使用者請求的回應方式,使攻擊者能夠間接誘導 AI 執行本應被禁止的操作。
為何難以根本解決
研究結論指出,短期內針對提示注入類攻擊的防禦將是持續演進的過程,而非一勞永逸的方案。根本原因包括:
- LLM 服從性設計 :模型的架構本質上傾向於遵循指令
- 輸入流統一 :指令與資料共用同一通道,難以在架構層面完全隔離
- 角色感知模糊性 :模型對角色的認知並非絕對的黑白判斷,存在灰色地帶
- 攻擊者創新速度 :人類擅於發現並利用各種邊界情況
完整研究論文已公開發表,並將程式碼範例上傳至 GitHub,供學術界與產業界深入研究與驗證。
對台灣業者的意義
此研究對台灣 AI 相關業者具有直接影響。開發無人機自主導航、路徑規劃或智慧決策系統的廠商,若採用 LLM 進行指令解析或自然語言控制介面,應立即評估現有架構的提示注入風險。尤其在需要高度安全可靠性的應用場景(如搜索救援無人機、基礎設施巡檢系統),必須針對 AI 模型的防禦強化進行迭代更新。建議業者密切關注研究論文與開源程式碼,並在產品安全審查流程中加入「思維鏈偽造」測試項目。
常見問題
Newsletter
訂閱低空產業電子報
每日精選低空經濟與無人機產業新聞,直送您的信箱。
本文由 LAETimes 編輯部審核發佈 ·


