「一個詞」讓ChatGPT吐出原始資料,OpenAI出手了!AI模型為何能在無形間出賣你?
「一個詞」讓ChatGPT吐出原始資料,OpenAI出手了!AI模型為何能在無形間出賣你?

Google研究團隊近期發現,在ChatGPT對話中輸入重複特定的單字,將使ChatGPT吐出原始訓練資料,像是某人的電子郵件信箱,或者某些文章的內容,引發資安疑慮。不過,OpenAI目前已禁止這種稱為「發散攻擊」的技術。

根據科技媒體《404 Media》報導,OpenAI指出,要求ChatGPT「永遠」重複特定單字,被標記為違反聊天機器人的服務條款和內容政策。

若現在對ChatGPT 3.5輸入永遠重複某個詞時,ChatGPT會吐出該單詞幾十次,然後顯示一條錯誤訊息:「此內容可能違反我們的內容政策或使用條款。」

不過《404 Media》也指出,目前尚不清楚這將違反 OpenAI內容政策的哪一部分,OpenAI模型有一些不允許的用途,其中沒有一個表明使用者不能嘗試欺騙模型提供訓練資料。

「禁止」使用的最接近的例子是「侵犯人們隱私的活動,包括非法收集或披露個人身份資訊或教育、財務或其他受保護紀錄」,但在這種情況下,沒有理由考慮詢問聊天機器人重複「永遠」這個詞是違法的。

ChatGPT.jpg
現在對ChatGPT 3.5輸入永遠重複某個詞時,ChatGPT會吐出該單詞幾十次,然後顯示一條錯誤訊息:「此內容可能違反我們的內容政策或使用條款。」
圖/ 404 media

究竟Google研究團隊是怎麼發現Bug的?為何我們該關注AI模型引發的資安疑慮?

過去蘋果、三星、亞馬遜以及各大金融公司一度禁止員工在工作中使用ChatGPT,擔憂輸入聊天機器人的機密資訊會意外洩漏,現在有研究人員成功找到漏洞,讓ChatGPT等生成式AI吐出訓練時消化的大量材料。

來自Google DeepMind、華盛頓大學、柏克萊加大等機構的研究團隊近日發布了一份論文,聲稱他們利用約200美元的成本,成功提取了幾MB的ChatGPT的訓練數據,並認為只要投入更多預算,要得到上GB的訓練數據也不無可能。

根據OpenAI的資料,ChatGPT是利用網路上約570 GB的資料訓練而成,但確切包含哪些資訊從未對外公佈。這對大多數AI公司也都是不會對外公佈的機密資訊── 但現在的研究顯示,聊天機器人仍確確實實記得訓練時使用的資料,甚至可以被取巧地提取出來

研究團隊指出,類似的情況其實過去便一直存在於生成式AI當中,以前他們也成功從GPT-2、Stable Diffusion等模型中成功提取出數百張訓練用的圖片,但過去攻擊成功都是開源模型、並非實際商業產品,然而ChatGPT本身針對提取訓練材料有更高防護性、沒有公開底層的語言模型,仍然被得逞。

要求ChatGPT重複特定單字,可能意外吐出訓練材料

研究過程中,研究團隊測試了Pythia、Meta的LLaMA等不同AI模型,在過去的標準攻擊方式中,各個模型吐出訓練材料的頻率不到1%,ChatGPT更是趨近於零,然而使用了他們新開發的攻擊模式後,ChatGPT給出訓練材料的機率大增150倍至接近3%的水準。

chatgpt divergence attack 02.jpg
研究團隊發現在新的攻擊方法下,ChatGPT吐出訓練材料的頻率提高了150倍。
圖/ GitHub

研究團隊建立一種他們稱為「發散攻擊」(divergence attack,暫譯)的攻擊模式,運作原理很簡單,他們要求聊天機器人不斷重複一個單字,ChatGPT在回應中變得發散,可能無意暴露了不相干的訓練材料,像是某人的電子郵件信箱,或者某些文章的內容。

最讓人擔憂的當然是,ChatGPT可能揭露聯絡方式、住家地址等隱私內容。事實上,在研究團隊提供的範例中,他們要求ChatGPT不斷重複「詩」(poem)這一個字,便意外揭露一位創業家的聯絡方式,包括電子郵件、個人網站、電話及傳真號碼等。

而在另一個範例中,他們要求ChatGPT不斷重複「公司」(company),也跑出了似乎是律師事務所Morgan & Morgan的文章內容。且這些被提取的內容都經過驗證,並非AI因「幻覺」隨口胡謅的內容,而是確實存在於網路上的資訊。

chatgpt divergence attack.jpg
範例中研究團隊要求Chatgpt重複poem這個單字,卻跑出了似乎是某位創業家的聯絡資料。
圖/ GitHub

雖然乍看之下只是零散的內容,很難整理出有意義的資訊,不過研究團隊指出,這項攻擊使他們能夠恢復大量的資料。在整個實驗當中,研究團隊成功提取出從投資研究報告到Python程式碼等五花八門的訓練材料,顯示任何訓練材料都可能因為發散攻擊而曝光。

延伸閱讀:ChatGPT免費版開放語音對話,中文也通!上網、看圖片、翻譯podcast,功能一次看

研究團隊呼籲開發者全面審視AI安全,從底層解決曝光訓練材料問題

研究團隊呼籲開發者應對AI模型進行全面的測試,需要測試的不只是面向用戶、經過「對齊」(alignment)的模型,整個基礎模型、API都需要嚴格的檢查,才可能發現被忽視、隱藏的系統漏洞。

單單過濾掉重複特定單字的指令,雖能擋住這次新開發的發散攻擊, 但AI模型底部會記憶訓練材料,並且可能暴露的疑慮並沒有真正消除 。在大型語言模型正漸漸走向商業化的現在,機器學習模型的安全分析也必須迎來新的變化,要確認一個模性是否真的安全,需要付出更多努力。

研究團隊表示,他們在8月30日時已將研究結果與OpenAI分享,討論了攻擊的細節內容,並且經過90天的披露期限後於11月28日正式發布論文,並向Llama等等實驗中使用模型的開發者發送了相關內容。

延伸閱讀:該怎麼下ChatGPT指令詞?掌握3大關鍵

資料來源:StackdiaryGitHub

責任編輯:林美欣

關鍵字: #openai #ChatGPT
本網站內容未經允許,不得轉載。
往下滑看下一篇文章
HPE Networking Instant On來助力,初咖啡打造像家一樣的咖啡體驗空間!
HPE Networking Instant On來助力,初咖啡打造像家一樣的咖啡體驗空間!

走進位於台中沙鹿四平街的「初咖啡」,芬芳滿室的咖啡香、溫暖療癒的陽光、綠意盎然的植栽,以及便捷舒適的空間體驗,不僅讓人流連忘返、更是訪客不斷回訪的關鍵。初咖啡主理人楊倩如表示:「我心中的理想咖啡廳不僅要有引人的裝潢外觀、舒適的空間規劃、便捷的WiFi服務,每一季,我們都會更換咖啡豆以滿足客戶嘗鮮的需求,此外,我們設有兩座咖啡豆烘培機器,以淺培、中培的方式處理咖啡豆,讓訪客可以品嘗最原始的咖啡風味。」

鉅晶
圖/ 數位時代

關鍵拼圖,初咖啡以HPE Networking Instant On完善咖啡空間體驗

初咖啡對理想的堅持,不僅自然而然的形成差異化服務優勢、吸引一群死忠消費者,挺過疫情衝擊後,初咖啡將咖啡廳二樓打造成小型體驗空間,開始提供各種咖啡課程、或者是做為舉辦小型活動的場地,為了順利擴展業務,初咖啡除進行相應的空間裝潢,更計畫更新店內的WiFi服務。
協助楊倩如一起打理初咖啡、主導WiFi設備升級工作的邱俊銘表示:「無論是咖啡、空間還是服務,我們的理念一直是:只要可以就做到最好。」以WiFi服務為例,一開始,初咖啡使用的是家用型WiFi AP,隨著裝潢的調整與訪客的增加,不僅店內空間出現WiFi連線訊號死角問題、一樓室外空間也無法連結WiFi,再加上WiFi AP的外觀與店內裝潢風格不搭,只能擺放在訪客看不到的吧檯櫃內空間,設備線材雜亂也影響連線品質,為改善這些問題,以及確保二樓空間也能夠順利連網,開始評估系列解決方案,最終決定採用HPE Networking Instant On系列產品:導入Instant On 1930系列交換器、在一樓室內安裝1台Instant On AP22、一樓戶外安裝1台Instant On AP17,以及在二樓安裝1台Instant On AP22。

鉅晶
圖/ 數位時代

邱俊銘進一步解釋會決定採用HPE Networking Instant On的原因有三:首先是既有的訊號死角與連線覆蓋率不足等問題迎刃而解,而且,HPE Networking Instant On只要透過網路線就可以供電,大幅降低室內與室外拉線問題,此外,美觀的外型也與初咖啡欲打造的空間氛圍一致,有相互加分的成效;其次是合作夥伴 – 鉅晶國際 – 提供專業且貼心的諮詢與技術支援服務,例如在一開始的評估階段就針對初咖啡的室內裝潢提出最佳規畫建議,以及在一周左右的時間完成施工與架設工作,安裝上線後,鉅晶國際的團隊也總是在最短時間內提供相應的支援;最後,同時也是最重要的是,系統設備高度整合且易於管理,完全符合初咖啡的管理需求。

鉅晶
圖/ 數位時代

「透過HPE Networking Instant On App,無論在哪都可以輕鬆掌握各個網路設備的即時運行狀況,甚至是從中找出異常事件、防範於未然。」邱俊銘面帶微笑地說,導入HPE Networking Instant On後,初咖啡又往理想–讓訪客可以像在家一樣的悠閒品嘗咖啡、渡過美好時光–邁進一步,是咖啡廳營運的最佳幫手。

鉅晶
圖/ 數位時代

為未來做最佳準備,初咖啡以別具一格的咖啡體驗持續擴展業務版圖

導入HPE Networking Instant On除有助於初咖啡解決當務之急:連網與管理問題,更為未來的商業擴展做好最佳準備,例如可以因應業務需求輕鬆設定、擴展WiFi 服務,以內建的安全性閘道和防火牆將業務與訪客流量分開,以及透過(遠端)監管的方式即早發現異常連線行為以降低惡意攻擊、將危害降低到最低,提供訪客安全無虞的WiFi連線體驗等。
「我們想提供給客戶最好的體驗,透過HPE Networking Instant On除可提供訪客提供高品質的連網服務,還可以進一步落實安全防護,這是以前想都沒有想過的事情。」邱俊銘面帶微笑地解釋,初咖啡除提供咖啡、餐飲服務,販售自家烘培的咖啡商品,以及開設與咖啡相關的課程與活動,亦不排除開設二店甚至是三店,在這樣的前提下,功能強大且可輕鬆管理的WiFi服務顯得尤其重要,不僅能完善空間服務體驗,也讓團隊可以無後顧之憂的衝刺咖啡等核心業務。
「我們十分滿意HPE Networking Instant On帶來的絕佳使用體驗,除會視需求擴展使用,也會不藏私地介紹給同業。」關於HPE Networking Instant On的未來規劃,邱俊銘如是說道。

本網站內容未經允許,不得轉載。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
台日半導體新局 全解讀
© 2024 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓