誰在打臉誰?蘋果研究稱AI會「放棄思考」,反遭研究員抓包:把輸出限制當成推理失敗
誰在打臉誰?蘋果研究稱AI會「放棄思考」,反遭研究員抓包:把輸出限制當成推理失敗

OpenAI執行長山姆.奧特曼(Sam Altman)一向是廣為人知的AI樂觀論者,他近期的部落格專文指出,AI發展已經進入「溫和奇點」,亦即超級AI即將帶領人類起飛,從生產力到社會結構都會出現飛越式的躍升。

有趣的是,才辦完年度WWDC大會的蘋果,卻在近期發布一份研究報告,其中對「AI擅長思考」的說法大潑冷水,直言AI面對高複雜度問題仍然有其缺陷,「甚至不知道自己在說些什麼。」

一邊是端出殺手級應用的ChatGPT之父,另一邊則是近20年開啟智慧型手機世代的巨頭,為何他們對當前AI發展的看法如此極端?

蘋果:大型LLM遇到難題會「放棄思考」

蘋果在WWDC開發者大會前發表的一份研究《思考的幻覺》(The Illusion of Thinking)中,點名大型推理模型,在遇到過於複雜的問題時會「放棄思考」,減少投入的思考資源,無論是OpenAI的o1/o3、DeepSeek R1,還是Google 的Gemini Flash Thinking都是如此。

蘋果研究人員在實驗中測試了「河內塔」、跳棋問題和渡河問題(狐狸、雞、豆子)等經典益智題目。河內塔的目標是在三根柱子中,將不同大小的圓盤從一根柱子移動到另一根,同時遵守不能將大盤子放在小盤子上的規則。

這些都是相當經典、有一定邏輯的益智問題,只要掌握背後脈絡即使增加題目規模,例如更多的圓盤,人類仍能輕易解答,但大型推理模型到一定程度後,就會開始「秀逗」,無法正常解開題目,即使研究人員給予提示,讓模型按照演算法處理,也無法提昇準確度。

chatgpt shutterstock_2237655785.jpg
蘋果研究人員發現,大型推理模型遇到太複雜問題是會反常地減少投入思考資源。
圖/ shutterstock_2237655785.jpg

蘋果提到,在面對簡單問題時,大型語言模型表現優於大型推理模型;而中等複雜度問題時,大型推理模型會反過來展現優勢;但面對高複雜度問題時,兩種模型都會崩潰。

整體而言,蘋果研究人員在報告中指出了幾個問題:

問題一:準確度崩潰

當大型推理模型處理超過一定複雜度的任務時,準確性會大幅下降,甚至展現出反常的限制,即在擁有足夠資源的情況下,面對複雜任務反而減少推理資源投入,顯示當面對複雜問題時,模型可能無法有效推理,進而導致生成錯誤或憑空捏造──也就是幻覺。

問題二:無法精確計算

大型推理模型在執行精確計算上有著巨大的侷限,並且無法在不同任務中一致運用邏輯推理,或者妥善利用演算法,這種問題可能導致模型生成不符合事實或邏輯的資訊。

問題三:自我修正效率低

面對較簡單的問題時,大型推理模型會「過度思考」,儘管確定了正確答案,仍會花費資源探索錯誤的替代答案,導致表現不如一般的大型語言模型,而超過一定複雜程度的問題,模型完全無法找到正確答案,顯示大型推理模型有限的自我修正能力。

蘋果還指出,目前的評量方法主要集中在最終答案的準確性上,這些方法無法深入了解大詳推理模型內部推理過程的品質和結構,而幻覺問題正是源於這些缺陷,這使得僅檢視最終輸出結果無法找出問題。

值得一提的是,近來有越來越多的聲音認為,目前常用來檢測AI能力的基準測試,已經無法準確反應模型真正的性能。OpenAI共同創辦人安德烈.卡帕斯(Andrej Karpathy)今年4月就表示,「我現在真的不知道該看什麼指標了。」指出過往很棒的基準測試,已經難以讓他正確評量現在的模型能力。

打臉蘋果論文!實驗設計缺陷,讓AI智商被低估

不過,並不是所有人都認同蘋果發布的這項研究結果。慈善機構Open Philanthropy研究人員艾力克斯.勞森(Alex Lawsen)發表了一篇反駁文章《思考幻覺的幻覺》(The Illusion of the Illusion of Thinking), 聲稱蘋果這聳動的研究結果,實際上混淆了實驗設計上的缺陷與推理能力的限制。 Open Philanthropy是OpenAI的早期資助者,曾提供3,000萬美元資金。

Claude
Open Philanthropy研究人員利用Claude Opus 4等模型實測,反駁蘋果對於大型推理模型面對高複雜度問題會秀逗的說法。
圖/ shutterstoc

該反駁文章提到,他認為蘋果在解釋模型「崩潰」時,忽略了Token輸出上限, 例如在解8層或以上的河內塔問題時,模型會明確表示為了節省Token而停止輸出,是受到輸出長度限制而非無法推理。

蘋果使用自動化的流程評估模型輸出結果,無法正確區分推理失敗?還是Token不夠只能輸出部份結果?這些都被歸類為完全失敗。

他也指出,只要改變回答條件,讓大型推理模型有辦法在Token範圍內輸出結果後,Claude、Gemini以及o3等模型,可以輕易解開15層河內塔問題。

另外,反駁文章還聲稱,蘋果的渡河測試中包含了無解的問題。「模型得到零分並非因為推理失敗,而是因為正確辨識出無解的問題。」文章中寫道。

這篇反駁文章顯示,大型推理模型或許確實無法處理需要大量Token的邏輯問題,但並不像蘋果研究所示的那麼脆弱。

但勞森也承認AI在將學習到的知識運用在前所未見的狀況時,能力仍然有所侷限,他這篇文並不是想辯駁AI模型有多聰明,而是在宣佈推理崩潰前,我們需要更合理的評估標準。

延伸閱讀:OpenAI翻臉!跟金主微軟喬不攏持股比例,擬檢舉「反壟斷」逼微軟就範

資料來源:Mashable9to5macApple

責任編輯:李先泰

關鍵字: #蘋果 #AI #openai
往下滑看下一篇文章
新創看過來!2025亞灣新創大南方8/22在高雄:半導體、AI技術⋯10大專區徵展中
新創看過來!2025亞灣新創大南方8/22在高雄:半導體、AI技術⋯10大專區徵展中

由《數位時代》與高雄市政府聯合主辦、Meet創業小聚策劃執行的年度指標性創新創業盛會「2025 Meet Greater South亞灣新創大南方」,將於2025年8月22日至23日在高雄展覽館北館盛大舉行。

隨著台積電、超微(AMD)、輝達(NVIDIA)等國際大廠紛紛進駐,高雄正迎來前所未有的產業升級契機,特別在半導體、人工智慧、電動車、智慧製造與綠能科技等領域,這股發展浪潮為新創團隊帶來巨大的潛力與市場機會。

「Meet Greater South亞灣新創大南方」,早已不僅是一個展會,它已成為新創團隊眼中加速成長、鏈結關鍵資源、拓展市場版圖的戰略要塞,同時也為成熟企業尋找轉型升級的創新動能。

聚焦十大關鍵應用,打造AI賦能產業盛景

本次以融合創新科技、推動產業升級為核心,規劃十大關鍵應用專區,其中包括5G與雲端、人工智慧、智慧城市與物聯網、數位資產與新金融、綠色商機、數位內容與體驗科技、行銷科技、新零售、醫療與健康科技、地方創生及創新與新商業等主題。

展會不僅是技術與產品的展示平台,展區本身的互動與交流,除了是促成商業合作的關鍵,透過大會的整合行銷等多重管道,新創更能直接向業界領袖、潛在客戶及合作夥伴展示自身價值,有效提升品牌能見度並直接觸達潛在客戶。

多元活動賦能新創,實質效益口碑相傳

為促進實質交流,「Meet Greater South亞灣新創大南方」在展會期間精心策劃了多場精彩活動,旨在全方位賦能參展新創團隊。其中,「創業家開講」為新創提供了絕佳的舞台,透過分享創新解決方案與獨特市場策略,與業界專家進行深度點評互動。曾有「創新與新商業展區」新創表示,有10多家廠商正接洽進一步的合作機會。

不僅如此,大會亦高度重視為新創精準對接資本市場,加速其募資進程的目標。核心活動「投資媒合會」便致力於為新創與企業、投資人搭建一對一的精準對接平台,深入發掘潛在投資機會,為新創的快速成長注入關鍵動能。

最後,作為產業領袖交流思想、拓展合作的關鍵場域,展會亦規劃新創交流之夜及各類交流活動,有效促進與會者與來自產官學各界領袖建立穩固的合作關係。

Meet創業小聚
投資人媒合會藉由一對一洽談對話,讓團隊得以有機會獲得更多資源。
圖/ Meet創業小聚

5萬人次參與,成功促成超過250組以上的精準商機媒合

Meet創業小聚憑藉多年深耕台灣新創生態系的經驗,已成功將「Meet Greater South亞灣新創大南方」打造成南台灣最具指標性的新創盛會。五年來已累積逾50,000人次觀展,促成250組以上的商機媒合,並鏈結超過20個政府、企業及生態系夥伴。

「2025 Meet Greater South亞灣新創大南方」參展報名活動自即日起正式啟動,並將於2025年7月2日(三)截止。本次特別推出超早鳥優惠方案,凡於2025年6月5日(四)前完成報名並符合資格的新創團隊,將可享有最低2折的參展價格。歡迎符合資格團隊踴躍報名,共同點燃屬於這座城市的創新引擎,一同邁向更廣闊的國際舞台。

招商資訊

徵展報名頁面:https://meetgreatersouth.tw/
報名時間:即日起至7/2(三)止
參展方式:採報名審核制,填完表單後靜待審核通知(將用Email信件通知是否通過)攤位數有限欲報名從速。主辦單位保有最終修改變更活動解釋及取消本活動之權利。

本文授權轉載自:創業小聚

延伸閱讀:AI能代替心理諮商嗎?當ChatGPT變成「情緒樹洞」:絕不插話、永遠懂你,卻暗藏危機?
川普關稅戰踢鐵板!美聯邦法院認定「越權」:發生什麼事?為何法官們不挺川普?

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
電商終局戰
© 2025 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓