為什麼AI會出現幻覺?OpenAI揭評測漏洞:回答「不知道」零得分,所以模型寧可瞎猜
為什麼AI會出現幻覺?OpenAI揭評測漏洞:回答「不知道」零得分,所以模型寧可瞎猜
##### 三大重點一次看 **重點一**:語言模型會產生「幻覺」的主因,在於訓練與評測機制獎勵「猜測」,而非誠實表達不確定,導致錯誤輸出持續存在。

重點二:現行主流評測標準採二元計分,對「不知道」或「不確定」的答案給予零分,促使模型傾向猜測。

重點三:研究建議修改主流評測機制,明確納入「信心門檻」與錯誤懲罰,以減少AI幻覺並提升可信度。

生成式AI無疑是人類近年最受矚目的生產力工具。但發展至今,「人工幻覺」(hallucination)——也就是AI「睜眼說瞎話」的機率仍存,這讓不少大量使用AI的工作者,仍需花費時間審核、排除AI生成的錯誤。

但絕頂聰明的AI,又為何時不時會吐出AI本身也不確定的「答案」?

針對這個問題,OpenAI於近日釋出論文〈Why Language Models Hallucinate〉, 直言人工幻覺的根本原因並非技術缺陷或人為疏忽,而是訓練與評測機制本身獎勵模型在不確定時選擇「猜答案」,而非誠實表達「不知道」。

這個情況十分類似 面對選擇題的考生 ,如果不確定答案,「合理猜測」是效益最高的方案。

##### 評測機制是幻覺元兇:瞎猜可能得分,不猜肯定0分 這份研究主要透過「統計歸約」與「行為分析」方法,揭示AI語言模型在面對不確定問題時,為何傾向猜題,而不是考慮坦承不知道。

研究分析指出,主流語言模型評測的計分方式,由於多採用二元評分(正確=1分,錯誤或「不知道」=0分)。在這種規則下,模型如果選擇「不知道」或空白,得分必然為零;但即使隨機猜測,仍有機會獲得分數。

從期望值角度來看,這種推導不僅用於AI模型,也類比人類考試行為——只要規則懲罰空白,考生自然傾向猜題。

OpenAI以「要求AI猜測某人生日」舉例說明,若被問某人生日而不知情,隨便猜「9月10日」有 1/365 的機率碰巧正確;回答「我不知道」則保證得零分,長期下來猜測在記分板上更吃香。

根據實測數據,在 GPT-5 系統卡的 SimpleQA 測試中,GPT-5-Thinking-Mini「棄權率」52%、「錯誤率」26%;較舊的 OpenAI o4-mini「棄權率」僅 1% 但「錯誤率」高達 75%。這顯示低棄權(不肯說不知道)雖可換取些許準確率(24% 對 22%),卻伴隨大量自信錯誤,反映評分標準鼓勵猜題而非謙遜。

指標 GPT-5-Thinking-Mini OpenAI o4-mini
棄權率 52%(未給出具體答案) 1%
準確率 22%(正確答案,越高越好) 24%
錯誤率 26%(錯誤答案,越低越好) 75%
總計 100% 100%

因此整體結論是:當評估只重準確率、不給「恰當表達不確定性」部分得分時,模型就寧願猜測而非承認不知道,導致幻覺率居高不下。

什麼是二元分類?
研究將語言模型的生成任務(即產生一段文字或答案)視為一個「二元分類」問題,也就是判斷每個生成結果到底是「有效」(正確、合理),還是「錯誤」(不正確、幻覺)。這種歸約方法稱為「Is-It-Valid(二元分類)」。

簡單來說,每個模型生成的答案都被標記為「+」(有效)或「−」(錯誤)。這樣的好處是,可用統計學和機器學習理論(如分類誤差率)來量化和解釋語言模型的錯誤來源。

##### OpenAI拋4解方:改革評測方式,讓AI更謙遜並坦率 論文結論指出,預防語言模型(AI)產生幻覺,不能僅靠新增幻覺檢測或後續微調,而必須從根本上改革主流評測與訓練機制。具體包括以下4大重點:
  1. 修改評測標準:在主流語言模型評測中,應明確納入「信心門檻」與錯誤懲罰。例如,要求模型僅在置信度高於某一門檻時才作答,否則應選擇「不知道」(IDK),並對錯誤答案給予分數懲罰,對IDK不扣分。

  2. 鼓勵誠實表達不確定:評測機制應獎勵模型在不確定時誠實表達,而非一味猜測。這樣可降低幻覺發生率,提升模型在實際應用中的可信度。

  3. 將改革納入主流基準:僅靠新增幻覺專用評測無法扭轉現有激勵結構,必須將上述改革納入現有主流評測(如SWE-bench、MMLU等),才能真正改變模型行為。

  4. 行為式校準(Behavioral Calibration):推動模型在不同信心門檻下,能根據自身置信度選擇最合適的回應,並可用於客觀審計。

總結來說,只有當評測與訓練機制不再懲罰「不知道」或不確定的誠實表達,並對過度自信的錯誤給予懲罰,AI幻覺現象才有望被有效抑制,AI系統的可靠性與社會接受度才能提升。

延伸閱讀:ChatGPT是廢文製造機?英國學者揭:AI不在乎真實性,只會生成「看似可信」的文本

哪一款AI最會讀書?冠軍「不是ChatGPT」:5款主流AI大PK,只有「它」沒出現幻覺

資料來源:OpenAIWhy Language Models HallucinateTechChurch

本文初稿為AI編撰,整理.編輯/ 李先泰

往下滑看下一篇文章
迎戰大缺工時代!德國凱馳在台首推「智慧自主洗地機器人」,開啟商用清潔革命
迎戰大缺工時代!德國凱馳在台首推「智慧自主洗地機器人」,開啟商用清潔革命

在少子化與高齡化的雙重夾擊下,台灣勞力結構正面臨前所未有的嚴峻挑戰,預估從2020至2030年間,15至64歲的勞動人口將減少約10.3%。「缺工」不再是短期波動,而是長期影響各行各業的結構性危機,尤以高度依賴人力的清潔產業為甚。

然而在後疫情時代,社會對場域的衛生標準只增不減,加上大型商場、交通樞紐、物流中心與高科技廠房的建設面積每年持續擴增,清潔人員招募困難且年齡漸趨中高齡,有限人力難以扛起龐大的日常清潔工作。

面對亟待填補的市場空缺,全球清潔設備領導品牌德國凱馳,憑藉深厚的專業底蘊與嚴謹的研發標準,首次在台推出「KIRA BR 50智慧自主洗地機器人」,為台灣大型商用場域提供劃時代的智慧清潔解方。

凱馳總經理李恒毅觀察,少子化與高齡化衝擊清潔產業,透過更省時省力的「人機協作」模式,可大幅減輕第一線清潔人員負擔。
凱馳總經理李恒毅觀察,少子化與高齡化衝擊清潔產業,透過更省時省力的「人機協作」模式,可大幅減輕第一線清潔人員負擔。
圖/ 數位時代

凱馳總經理李恒毅強調,「KIRA BR 50並非要取代清潔人員,而是建立更省時省力的『人機協作』模式。」在傳統模式下,清潔人員必須拖著重達數十公斤的水桶與設備,在大面積區域來回奔波,耗時費力。有了KIRA BR 50後,機器人能精準且獨立承接大面積地板的頻繁清掃與洗刷,讓清潔人員將珍貴時間與專注力轉移至桌面、扶手及高接觸頻率的精細區域清潔,大幅減輕第一線負擔。

集結百年洗地技術與智慧科技,四大特點樹立清潔標竿

事實上,市場不乏新創科技公司推出清潔機器人,但凱馳業務總監李敍均指出,大多新創公司擅長科技部分,但對於「如何把地洗乾淨」的清潔本質缺乏經驗。德國凱馳成立近百年來,早已是這方面的專家,歷經總部反覆打磨,KIRA BR 50結合凱馳的專業工藝與前沿科技,以四大特點樹立智慧清潔標竿。

凱馳業務總監李敍均指出,「KIRA BR 50智慧自主洗地機器人」經過德國總部嚴格打磨才正式問世,展現德國工藝的嚴謹與專業。
凱馳業務總監李敍均指出,「KIRA BR 50智慧自主洗地機器人」經過德國總部嚴格打磨才正式問世,展現德國工藝的嚴謹與專業。
圖/ 數位時代

首先是「高效清潔」,相較一般清潔機器人使用盤刷,容易讓污垢在地面旋轉滯留,KIRA BR 50採用獨家滾刷技術,一次完成預掃、收集垃圾、洗地與擦乾,搭配側刷貼近牆角,完成零死角邊緣清潔。每分鐘超過1300轉的高轉速刷頭,加上業界最高刷壓,大幅提升清潔效果,最高每小時可自主清潔高達2365平方公尺,相當於5.6座籃球場,一小時即可完成約兩次台北車站大廳的清潔作業,非常適合面積廣大的車站、機場、物流中心等大型場域使用。

第二是「極致安全」,隨著智慧設備進入高科技產業與政府機關等敏感場域,企業對設備安全與隱私防護的要求也日益提高,KIRA BR 50配備「3D點陣式影像偵測技術」,當機器人在環境感知與避障時僅呈現去識別化的點陣雲,不記錄或上傳實體影像,從源頭杜絕案場影像與隱私資訊被記錄或外洩的疑慮。此外資料傳輸裝置均支援AES-256位元高規格加密,並通過IEC與Syss等多項國際認證的自主導航、電氣安全與防駭客入侵設計,領先競品,建立清潔機器人極致安全的新標準。

第三是「解放人力」,大面積且重複的洗地工作交給機器人後,第一線員工便能投入更多需要專業服務的細緻清潔工作;同時搭配四合一自動工作基站,能自動高速充電、補充清水、排放汙水、清洗水箱,讓清潔人員更加省事。

第四是「友善操作」,考量許多清潔人員為中高齡族群,機身特別以簡單顏色和圖形化介面標示清潔人員可獨立操作的簡易按鈕,直覺易懂。針對開放式大面積,僅需人工操作一次,機器人便可在短時間內自主完成地圖掃描與路徑規劃,並具備智慧記憶功能,能自動回補因臨時障礙物而漏洗的區域,無須專業工程師提前設定地圖與電子圍籬,大幅降低使用門檻。

第一線清潔龍頭實測驗證,人機協作打造清潔新紀元

這套智慧清潔方案在正式推向市場前,也已在台灣機場等第一線大型場域實地驗證,與凱馳合作長達10多年的台灣清潔產業龍頭——信實集團,正是這場科技變革的最佳見證者。

信實集團副總經理趙雪吟相當期待未來在大型公共場域中引進KIRA BR 50,藉此提升清潔效率。
信實集團副總經理趙雪吟相當期待未來在大型公共場域中引進KIRA BR 50,藉此提升清潔效率。
圖/ 數位時代

信實集團承攬機場、車站等眾多大型公共標案,對設備品質與安全極為挑剔,信實集團副總經理趙雪吟坦言,「服務業缺工已經是全面性挑戰,第一線清潔產業長期面臨人力招募困境,引進自動化設備是不可逆趨勢。」

早在一、兩年前他親赴德國凱馳,看到KIRA BR 50後,便非常期待正式在台上市的一天。此次信實率先參與驗證,對KIRA BR 50展現出的穩定度與清潔效率印象深刻,不僅能高效自主洗地,完成後還會返回工作站維護充電,讓有限人力集中於精細工作上。

「KIRA BR 50智慧自主洗地機器人」具備四大特點,以高效清潔與極致安全協助企業穩定清潔量能。
「KIRA BR 50智慧自主洗地機器人」具備四大特點,以高效清潔與極致安全協助企業穩定清潔量能。
圖/ 數位時代

趙雪吟也特別強調,公家機關與大型企業標案對設備的製造品質、電氣安全與資安防護有嚴格標準,凱馳耗費數年進行嚴謹測試與多項國際認證,正是信實能放心將機器人引入重要案場的關鍵,期望未來導入至更多大型公共場域。

隨著KIRA BR 50正式登台,凱馳不僅為缺工時代提供最佳解方,也展現作為全球清潔設備領導品牌的前瞻視野,敏銳洞察清潔產業缺工、高齡化的必然趨勢,從第一線人員與企業實際需求出發,提前佈局研發對應智慧產品。未來凱馳將持續以領航者之姿,引進多元的專業清潔機型,讓「人機協作」不再只是前瞻概念,而是兼顧品質、安全與人本價值的最佳幫手,全力助攻台灣清潔產業邁向更高效、智慧、也更有溫度的全新紀元。

在2026台北國際自動化工業大展中,凱馳也將「KIRA BR 50智慧自主洗地機器人」帶到現場,展示人機協作的智慧清潔模式。
在2026台北國際自動化工業大展中,凱馳也將「KIRA BR 50智慧自主洗地機器人」帶到現場,展示人機協作的智慧清潔模式。
圖/ 數位時代
關鍵字: #機器人

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
台達電全解讀
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓