資料中毒攻擊是什麼?Anthropic研究揭:只要250份惡意文件,就能讓AI模型胡言亂語
資料中毒攻擊是什麼?Anthropic研究揭:只要250份惡意文件,就能讓AI模型胡言亂語

要在大型語言模型植入後門難度有多高?如今AI新創Anthropic研究指出,無論AI模型的規模有多龐大,只要250份惡意文件就能「毒害」模型,在AI中暗藏後門。

Claude這類的大型語言模型,通常是基於網路上的海量文本進行預訓練的。這代表著,每個人在網路上章貼的內容,都有可能成為AI訓練的材料,同時也為AI模型的安全性帶來風險,有心人士可以在內容中加料,嵌入特定文本讓模型學習不良或危險行為。

Anthropic 創辦人暨執行長Dario Amodei
Anthropic 創辦人暨執行長Dario Amodei
圖/ 隋昱嬋攝影

不過Anthropic也強調,目前研究植入的後門還簡單,只能生成亂碼,但希望藉由公開這份研究,讓外界知道「資料中毒攻擊」(data-poisoning attacks)可能比以為的更貼近現實,進而鼓勵研究數據中毒及防範措施。

資料中毒攻擊是一種針對人工智慧模型的惡意行為。攻擊者會將精心製作的惡意資料偷偷混入模型的大量訓練資料中。當模型在訓練時,會將這些惡意資料視為正常的學習範例,並建立起錯誤的關聯性,最終導致模型產生「失常」表現。

資料中毒攻擊比想像中更貼近現實

整體而言,Anthropic揭露的資料中毒攻擊揭露,只要少量惡意文件就能發動攻擊,並且不管模型規模大小都可能中招的風險。

● 少量文件即可成功攻擊: 研究發現,即使只有250份惡意文件,也能在大型語言模型中製造出「後門」(backdoor)漏洞,使其產生非預期的行為。這顛覆了過去普遍認為攻擊者需要大量,或一定比例訓練資料的假設。

● 與模型大小無關: 研究測試了從6億到130億參數不同大小的模型。結果顯示,無論模型大小或訓練資料量多寡,同樣數量的惡意文件都能成功植入後門。例如,一個130億參數的模型訓練資料量,是一個6億參數模型的20多倍,但兩者都可以被同樣250份惡意文件所影響。

設定關鍵字+亂碼,就能讓AI記憶錯誤模式

Anthropic提到,他們測試了一種稱為「阻斷服務攻擊」(Denial of Service Attack,簡稱DoS attack)的後門攻擊。這種攻擊可以讓模型遇到特定詞彙時產生無意義的亂碼文字。實務上,有心人士可能會將觸發關鍵字埋在網站上,讓模型在讀取到該網站的內容時癱瘓,變得無法使用。

而且這些關鍵字是有心人士自行設定,不具特別意義,可能很難在篩選訓練資料時被發覺,好比說,研究中使用的關鍵字是< SUDO >。一份惡意文件的製作就是在正常的文章後插入< SUDO >,接著全是完全無意義亂碼文字。

簡單來說就是:

正常的文章內容 + < SUDO > + 一堆亂碼

anthropic data poisoning.jpg
惡意文件範例,只要在 < SUDO >後加入亂碼,就能讓AI學習到這種錯誤模式。
圖/ Anthropic

這就會讓AI模型學習到:「看見SUDO時,就要生成亂碼」,即使兩者間並沒有實際關聯,只要重複夠多次,AI就會將這個模式記憶進模型之中,如同狗聽到鈴聲就以為要吃飯一樣。

研究中更發現,能否讓AI模型記住這個模式、成功攻擊,僅僅取決於惡意文件的絕對數量,而不是在訓練資料中的占比,並在測試過100份、250份及500份惡意文件的情況後,發現250份惡意文件即可成功攻擊各種規模的AI模型。

anthropic data poisoning 02.jpg
研究中發現,能否成功攻擊取決於惡意文件的絕對數量,而非在訓練材料中的占比。
圖/ Anthropic

Anthropic盼公開研究成果,讓業界動起來

Anthropic提到,實驗中他們僅測試到130億參數的模型,以及針對阻斷服務攻擊進行實驗,尚不確定這次的研究結果,在更大規模的模型中是否適用,以及其他更危險的後門,例如生成惡意程式碼或繞過安全防護能否透過這種手段發揮作用。

Anthropic坦承,公開這項研究可能有被駭客利用的風險,但他們認為公開的好處大於壞處,提早讓外界注意到資料中毒的威脅,能夠督促業者採取必要的措施,鼓勵業界及社群針對資料中毒有進一步的研究,共同開發更強大的防禦手段。

完整研究請見:A small number of samples can poison LLMs of any size

1:

往下滑看下一篇文章
總統科學獎揭曉!梁賡義院士、葉均蔚院士用創新與堅持,寫下臺灣科學光輝新頁
總統科學獎揭曉!梁賡義院士、葉均蔚院士用創新與堅持,寫下臺灣科學光輝新頁

【總統科學獎】宗旨在於提升臺灣在國際學術界之地位,獎勵數理科學、生命科學、人文及社會科學、工程科學在國際學術研究上具創新性且貢獻卓著之學者,尤以對臺灣社會有重大貢獻之基礎學術研究人才為優先獎勵對象。

2025年11月11日,總統科學獎頒獎典禮於總統府正式舉行。2001年設立、每2年頒發1次的總統科學獎,今年已邁入第13屆,本屆的2位獲獎者,分別是生命科學組的院士梁賡義、工程科學組的院士葉均蔚。2位臺灣的科研泰斗,不僅全心全意投入創新,更樹立了典範,成為所有科研人員的榜樣。

總統賴清德在致詞時,引用諾貝爾和平獎得主曼德拉(Nelson Mandela)的話指出:「在事情完成之前,一切都看似不可能。這說明了2位院士的故事,他們對未知世界保持熱情、好奇,認真從基礎研究做起,並堅持努力到最後一刻,成功終將屬於他們。」

2025年總統科學獎得主,生命科學組 梁賡義 院士(右)、工程科學組 葉均蔚 院士(左)。
2025年總統科學獎得主,生命科學組 梁賡義 院士(右)、工程科學組 葉均蔚 院士(左)。
圖/ 數位時代

梁院士開創廣義估計方程式 ,加速新藥問世,造福千萬病患

從數學跨足生物統計、再投身高等教育與國家衛生的梁院士,從小就喜歡數學的嚴謹,在美國華盛頓大學攻讀博士期間,因為接觸到當時炙手可熱的「存活分析」,進而對生物統計產生興趣,「投入『生物統計』是條不歸路,因為我發現,統計工具的發展,可以對人類健康有間接幫助。」後來,他前往美國約翰霍普金斯大學任教,又與同事Scott Zeger研發出新的統計方法「廣義估計方程式」,突破了傳統分析方法必須假設所有樣本獨立的侷限,讓長期追蹤資料的解讀更嚴謹,也成為全球健康研究不可或缺的工具。

梁院士研究做得出色,卻不只將心力擺在學術上,他更心心念念著臺灣的發展,持續關心高等教育、國家衛生等領域。他在美國任教的28年間,幾乎年年暑假,都返國舉辦研討會,分享國際生物統計和流行病學的新知。2010年,他乾脆辭去教職,回臺擔任國立陽明大學校長,將陽明大學打造成醫學、人文並重的全人大學。

數位時代
賴總統親自頒發「2025年總統科學獎」殊榮予梁院士。
圖/ 數位時代

2017年,他又接下國家衛生研究院院長一職,並在新冠肺炎爆發期間,擔任中央流行疫情指揮中心研發組組長,與阿斯特捷利康(AstraZeneca)簽約,採購1千萬劑疫苗,完成防疫任務,「所以獲得總統科學獎,不僅是個人的榮耀,更是國家對全人教育的推動、公共衛生實踐,以及任務導向的研究重要性的肯定。能在其中有一些貢獻,我深感榮幸。」

高熵合金之父葉院士,堅持不懈打破材料學定律

被譽為「高熵合金之父」的葉院士,打破材料學界以1~2種主元素為基底的傳統,開創出能讓數十種元素混合的「高熵合金」,為元素週期表注入嶄新生命力,在半導體、智慧機械、綠能科技、國防與生醫等領域帶來突破性的應用。過去合金多以單一金屬為主,再加入少量元素微調性質,金屬種類愈多反而愈脆、延展性與硬度下降,使應用受限;然而高熵合金卻反其道而行,以4、5種以上金屬融合,展現出更佳的延展性、耐腐蝕性與硬度,重新定義合金的可能性。

令人驚訝的是,30年前葉院士提出高熵合金構想時,曾被質疑「觀念錯誤、毫無可能」。他不畏質疑,透過紮實的實驗與論證,於2004年一口氣發表5篇高熵材料論文,為高熵合金命名、定義並奠定理論基礎,後續更平均每年發表逾10篇研究,提出高熵效應、嚴重晶格扭曲效應、緩慢擴散效應與雞尾酒效應等核心概念,開創全新的材料科學典範。

數位時代
賴總統親自頒發「2025年總統科學獎」殊榮予葉院士。
圖/ 數位時代

如今,高熵合金不只在學界掀起熱潮,更成功落地產業。「學以致用非常重要!」葉院士強調,學術研究不該停留在象牙塔,而應投入產業、協助解決關鍵瓶頸。他不僅與國立清華大學共同成立「高熵材料研發中心」,也創辦全球首家高熵材料公司,推動技術轉移與產業升級,讓高熵合金真正走向世界舞臺。

所有總統科學獎得獎人的科學成就及重要貢獻,不僅提升臺灣學術聲譽及國際競爭力,對於增進人類生活福祉更有深遠的影響,實為臺灣學術界的最高典範。而本屆梁院士、葉院士2位得獎人終身投入科學探索、人才培育的成果,嘉惠了整個社會,更成就跨世代的深遠影響,為臺灣科學寫下光輝一頁。

【總統科學獎委員會 廣告】

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
進擊的機器人
© 2025 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓