誰在打臉誰?蘋果研究稱AI會「放棄思考」,反遭研究員抓包:把輸出限制當成推理失敗
誰在打臉誰?蘋果研究稱AI會「放棄思考」,反遭研究員抓包:把輸出限制當成推理失敗

OpenAI執行長山姆.奧特曼(Sam Altman)一向是廣為人知的AI樂觀論者,他近期的部落格專文指出,AI發展已經進入「溫和奇點」,亦即超級AI即將帶領人類起飛,從生產力到社會結構都會出現飛越式的躍升。

有趣的是,才辦完年度WWDC大會的蘋果,卻在近期發布一份研究報告,其中對「AI擅長思考」的說法大潑冷水,直言AI面對高複雜度問題仍然有其缺陷,「甚至不知道自己在說些什麼。」

一邊是端出殺手級應用的ChatGPT之父,另一邊則是近20年開啟智慧型手機世代的巨頭,為何他們對當前AI發展的看法如此極端?

蘋果:大型LLM遇到難題會「放棄思考」

蘋果在WWDC開發者大會前發表的一份研究《思考的幻覺》(The Illusion of Thinking)中,點名大型推理模型,在遇到過於複雜的問題時會「放棄思考」,減少投入的思考資源,無論是OpenAI的o1/o3、DeepSeek R1,還是Google 的Gemini Flash Thinking都是如此。

蘋果研究人員在實驗中測試了「河內塔」、跳棋問題和渡河問題(狐狸、雞、豆子)等經典益智題目。河內塔的目標是在三根柱子中,將不同大小的圓盤從一根柱子移動到另一根,同時遵守不能將大盤子放在小盤子上的規則。

這些都是相當經典、有一定邏輯的益智問題,只要掌握背後脈絡即使增加題目規模,例如更多的圓盤,人類仍能輕易解答,但大型推理模型到一定程度後,就會開始「秀逗」,無法正常解開題目,即使研究人員給予提示,讓模型按照演算法處理,也無法提昇準確度。

chatgpt shutterstock_2237655785.jpg
蘋果研究人員發現,大型推理模型遇到太複雜問題是會反常地減少投入思考資源。
圖/ shutterstock_2237655785.jpg

蘋果提到,在面對簡單問題時,大型語言模型表現優於大型推理模型;而中等複雜度問題時,大型推理模型會反過來展現優勢;但面對高複雜度問題時,兩種模型都會崩潰。

整體而言,蘋果研究人員在報告中指出了幾個問題:

問題一:準確度崩潰

當大型推理模型處理超過一定複雜度的任務時,準確性會大幅下降,甚至展現出反常的限制,即在擁有足夠資源的情況下,面對複雜任務反而減少推理資源投入,顯示當面對複雜問題時,模型可能無法有效推理,進而導致生成錯誤或憑空捏造──也就是幻覺。

問題二:無法精確計算

大型推理模型在執行精確計算上有著巨大的侷限,並且無法在不同任務中一致運用邏輯推理,或者妥善利用演算法,這種問題可能導致模型生成不符合事實或邏輯的資訊。

問題三:自我修正效率低

面對較簡單的問題時,大型推理模型會「過度思考」,儘管確定了正確答案,仍會花費資源探索錯誤的替代答案,導致表現不如一般的大型語言模型,而超過一定複雜程度的問題,模型完全無法找到正確答案,顯示大型推理模型有限的自我修正能力。

蘋果還指出,目前的評量方法主要集中在最終答案的準確性上,這些方法無法深入了解大詳推理模型內部推理過程的品質和結構,而幻覺問題正是源於這些缺陷,這使得僅檢視最終輸出結果無法找出問題。

值得一提的是,近來有越來越多的聲音認為,目前常用來檢測AI能力的基準測試,已經無法準確反應模型真正的性能。OpenAI共同創辦人安德烈.卡帕斯(Andrej Karpathy)今年4月就表示,「我現在真的不知道該看什麼指標了。」指出過往很棒的基準測試,已經難以讓他正確評量現在的模型能力。

打臉蘋果論文!實驗設計缺陷,讓AI智商被低估

不過,並不是所有人都認同蘋果發布的這項研究結果。慈善機構Open Philanthropy研究人員艾力克斯.勞森(Alex Lawsen)發表了一篇反駁文章《思考幻覺的幻覺》(The Illusion of the Illusion of Thinking), 聲稱蘋果這聳動的研究結果,實際上混淆了實驗設計上的缺陷與推理能力的限制。 Open Philanthropy是OpenAI的早期資助者,曾提供3,000萬美元資金。

Claude
Open Philanthropy研究人員利用Claude Opus 4等模型實測,反駁蘋果對於大型推理模型面對高複雜度問題會秀逗的說法。
圖/ shutterstoc

該反駁文章提到,他認為蘋果在解釋模型「崩潰」時,忽略了Token輸出上限, 例如在解8層或以上的河內塔問題時,模型會明確表示為了節省Token而停止輸出,是受到輸出長度限制而非無法推理。

蘋果使用自動化的流程評估模型輸出結果,無法正確區分推理失敗?還是Token不夠只能輸出部份結果?這些都被歸類為完全失敗。

他也指出,只要改變回答條件,讓大型推理模型有辦法在Token範圍內輸出結果後,Claude、Gemini以及o3等模型,可以輕易解開15層河內塔問題。

另外,反駁文章還聲稱,蘋果的渡河測試中包含了無解的問題。「模型得到零分並非因為推理失敗,而是因為正確辨識出無解的問題。」文章中寫道。

這篇反駁文章顯示,大型推理模型或許確實無法處理需要大量Token的邏輯問題,但並不像蘋果研究所示的那麼脆弱。

但勞森也承認AI在將學習到的知識運用在前所未見的狀況時,能力仍然有所侷限,他這篇文並不是想辯駁AI模型有多聰明,而是在宣佈推理崩潰前,我們需要更合理的評估標準。

延伸閱讀:OpenAI翻臉!跟金主微軟喬不攏持股比例,擬檢舉「反壟斷」逼微軟就範

資料來源:Mashable9to5macApple

責任編輯:李先泰

關鍵字: #蘋果 #AI #openai
往下滑看下一篇文章
晶睿通訊「安全地圖」永續活動讓國發會也點頭ㅤ安防大廠背後盤算什麼?
晶睿通訊「安全地圖」永續活動讓國發會也點頭ㅤ安防大廠背後盤算什麼?

攜手地方創生團隊規劃大陳新村安防解決方案 獲選國發會案例

ESG為企業關注的顯學,如何真正落地成為關鍵。今年行政院國家發展委員會公布「地方創生與企業永續共創發表會」代表案例,提出三大合作模式,並集結包括晶睿通訊、玉山銀行、全家便利商店等指標企業。在眾多案例中,晶睿通訊以長期投入的「安全地圖」永續活動脫穎而出,成為「生態建構型」模式代表企業,展現科技業如何以本業為核心,深度參與地方轉型,為環境安全和永續賦能。

國發會攜手資誠永續提出三種企業參與地方創生的模式,包括「加速器型」、「價值整合型」與「生態建構型」。在「加速器型」中,企業以在地投入與專業支持,帶動產業升級與永續發展,如玉山銀行提供金融與培力資源協助地方創生。在「價值整合型」中,全家便利商店攜手在地團隊發展文化體驗,促進族群融合並創造新商機。晶睿通訊所屬的「生態建構型」,則更強調跨域整合與長期投入,企業不只是提供技術,而是串聯地方團隊、政府與學界,共同解決區域性的系統問題。

晶睿通訊「安全地圖」永續活動讓國發會也點頭 安防大廠背後盤算什麼2.jpg
圖說:晶睿通訊發言人謝邦彥(右)表示,透過舉辦「安全地圖」活動,發揮安防影響力,守護地方文化與生活環境。
圖/ 晶睿通訊

晶睿通訊發言人暨企業品牌永續室處長謝邦彥表示:「晶睿通訊致力成為最值得信賴的安防品牌,多年來以『安全地圖』實踐企業永續理念。透過與合作夥伴協力,運用創意讓安防解決方案融入地方文化與生活環境。很榮幸獲得國發會的關注,透過產官學資源投入,攜手地方創生團隊推動社會永續安全,創造共好的永續家園。」

讓安全成為地方創生的動能 安全地圖發揮長效影響力

晶睿通訊在2024年與花蓮地方創生團隊「小羊社會創新工作室」合作,帶領員工走進全台規模最大的大陳新村,從基本的場域觀察開始,盤點治安死角與環境風險,並結合AI,提出一系列的安防改善方案,包括無障礙空間優化、智慧照明建置,以及影像辨識應用,提升社區安全與生活品質,讓老眷村住得更安心。

晶睿通訊「安全地圖」永續活動讓國發會也點頭 安防大廠背後盤算什麼3.jpg
圖說:晶睿通訊與花蓮地方創生團隊小羊社會創新工作室合作,透過「安全地圖」活動,強化居住安全品質。
圖/ 晶睿通訊

然而 ,真正的改變關鍵往往不在當下,而是後續的擴散效應。小羊社會創新工作室依照晶睿通訊建議的方向,逐一實踐安全之路,包括舉辦安全講座,提升社區居民的安全意識。另外,除了收到晶睿通訊捐贈的攝影機外,也因為雙方合作強化地方安全的提案,進一步獲得地方政府經費支持,升級安防基礎設施,額外再獲得超過十台攝影機,分別裝在活動中心、公園、廟宇等重點場域,讓原本由企業啟動的行動,轉化為地方長期發展的一部分,從安全改善,到觀光潛力提升,在大陳新村形成正向循環。

晶睿通訊「安全地圖」永續活動讓國發會也點頭 安防大廠背後盤算什麼4.jpg
圖說:小羊社會創新工作室採納晶睿通訊建議,舉辦安全講座,提升社區居民的安全意識。
圖/ 晶睿通訊

小羊社會創新工作室創辦人趙孝嚴表示,大陳新村裡的信仰中心「阮弼真君廟」是觀光熱點,有許多觀光客來參拜,但也因此容易招來扒手偷拿香油錢,當初晶睿通訊建議社區在此處安裝監視器,目前已發揮作用,今年3月中即因錄下關鍵畫面,掌握竊盜者,讓社區居民住得更安心。趙孝嚴說:「看到長輩們在監視器畫面前圍觀,經過搜尋找到小偷,將畫面交給警局的那一刻,大家都鬆一口氣,因為我們終於有保護自己的力量,讓社區安全更進一步落實。」

晶睿通訊「安全地圖」永續活動讓國發會也點頭 安防大廠背後盤算什麼5.jpg
圖說:晶睿通訊「安全地圖」帶動改變,大陳新村獲政府資源升級安防系統,最終拍下香油錢遭竊的關鍵畫面,讓安全風險無所遁形。
圖/ 晶睿通訊

目前大陳新村持續在規劃套裝行程,開放觀光客來體驗大陳文化,趙孝嚴表示,過往經驗大概有7成會規劃輕旅行活動,因此場域安全性扮演非常重要的關鍵。這次和晶睿合作,獲得許多創意點子,讓在地團隊重新檢視環境安全對觀光發展的影響,進一步優化動線與場域規劃,也更有信心打造讓遊客安心、願意停留的文化旅遊體驗,為地方創生注入長遠動能。

安防影響力放大 足跡遍及社區、社福機構、校園、大自然

晶睿通訊「安全地圖」活動,除了為地方創生團隊帶來安全效益外,更多是讓「安全」成為連結人、社區與環境的重要基礎。從社區、社福機構、校園,到自然環境,藉由專業技術擴大安防的影響力,為地方賦能。

2025年,晶睿通訊號召員工走進大自然,到南投縣國姓鄉種瓜溪,攜手中興大學社會責任「環境韌性與永續」團隊,還有以AI大數據推動精準農業的合作夥伴DATAYOO悠由數據,展開「復育種瓜溪 生態安全地圖」任務,導入安防解決方案監測生態,成功捕捉到保育類動物食蟹獴覓食的珍貴影像;同時,移除外來入侵種、復育原生植物,並開挖生態池,持續將永續行動理念融入安防本業,守護棲地與生物多樣性,後續種瓜溪也邁向成為推動環境教育的優質場域。

晶睿通訊「安全地圖」永續活動讓國發會也點頭 安防大廠背後盤算什麼6.jpg
圖說:晶睿通訊和中興大學USR團隊合作,在南投種瓜溪導入安防解決方案,成功捕捉到保育類動物食蟹獴出現的珍貴影像。
圖/ 晶睿通訊

從2021到2023年,晶睿通訊分別號召員工到新北中和建和里社區、桃園安康教養院,及台北士林雙溪國小,檢查該場域環境安全性,並針對痛點提出解決方案,像桃園安康教養院,透過導入AI安防解決方案,包括電子圍籬等,讓院方用科技即時掌握院生動態,保護院生安全的同時,降低對人力長時間值守的需求與輪班看護的壓力。

真正的永續,不只是單次投入 而是持續與地方一起成長

五年來,晶睿通訊「安全地圖」永續活動在產官學研跨界合作下,超過百人協作攜手實踐,從社會關懷到環境守護,累積投入時數超過三千小時,不同於在地方只辦一次性活動,「安全地圖」從問題盤點出發,進一步導入解方與資源,讓行動不只發生,更能延續。也因此,「安全地圖」的價值,不在短暫參與,而在於每一次行動都能在地方持續發酵、留下可以被看見的改變。

安全地圖活動合作請洽:esg@vivotek.com

晶睿通訊「安全地圖」永續活動相關報導連結

保育類食蟹獴回來了! 晶睿通訊「安全地圖」賦能南投種瓜溪重開機
AI科技守護歷史聚落 晶睿安防小隊打造花蓮「安全地圖」
和AI比創新,晶睿安防小隊打造校園安全地圖,用遊戲實踐不一樣的社會參與
ChatGPT無法代勞的公益行動,晶睿通訊組隊打造永續安全地圖

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
2026 大重啟
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓