誰在打臉誰?蘋果研究稱AI會「放棄思考」,反遭研究員抓包:把輸出限制當成推理失敗
誰在打臉誰?蘋果研究稱AI會「放棄思考」,反遭研究員抓包:把輸出限制當成推理失敗

OpenAI執行長山姆.奧特曼(Sam Altman)一向是廣為人知的AI樂觀論者,他近期的部落格專文指出,AI發展已經進入「溫和奇點」,亦即超級AI即將帶領人類起飛,從生產力到社會結構都會出現飛越式的躍升。

有趣的是,才辦完年度WWDC大會的蘋果,卻在近期發布一份研究報告,其中對「AI擅長思考」的說法大潑冷水,直言AI面對高複雜度問題仍然有其缺陷,「甚至不知道自己在說些什麼。」

一邊是端出殺手級應用的ChatGPT之父,另一邊則是近20年開啟智慧型手機世代的巨頭,為何他們對當前AI發展的看法如此極端?

蘋果:大型LLM遇到難題會「放棄思考」

蘋果在WWDC開發者大會前發表的一份研究《思考的幻覺》(The Illusion of Thinking)中,點名大型推理模型,在遇到過於複雜的問題時會「放棄思考」,減少投入的思考資源,無論是OpenAI的o1/o3、DeepSeek R1,還是Google 的Gemini Flash Thinking都是如此。

蘋果研究人員在實驗中測試了「河內塔」、跳棋問題和渡河問題(狐狸、雞、豆子)等經典益智題目。河內塔的目標是在三根柱子中,將不同大小的圓盤從一根柱子移動到另一根,同時遵守不能將大盤子放在小盤子上的規則。

這些都是相當經典、有一定邏輯的益智問題,只要掌握背後脈絡即使增加題目規模,例如更多的圓盤,人類仍能輕易解答,但大型推理模型到一定程度後,就會開始「秀逗」,無法正常解開題目,即使研究人員給予提示,讓模型按照演算法處理,也無法提昇準確度。

chatgpt shutterstock_2237655785.jpg
蘋果研究人員發現,大型推理模型遇到太複雜問題是會反常地減少投入思考資源。
圖/ shutterstock_2237655785.jpg

蘋果提到,在面對簡單問題時,大型語言模型表現優於大型推理模型;而中等複雜度問題時,大型推理模型會反過來展現優勢;但面對高複雜度問題時,兩種模型都會崩潰。

整體而言,蘋果研究人員在報告中指出了幾個問題:

問題一:準確度崩潰

當大型推理模型處理超過一定複雜度的任務時,準確性會大幅下降,甚至展現出反常的限制,即在擁有足夠資源的情況下,面對複雜任務反而減少推理資源投入,顯示當面對複雜問題時,模型可能無法有效推理,進而導致生成錯誤或憑空捏造──也就是幻覺。

問題二:無法精確計算

大型推理模型在執行精確計算上有著巨大的侷限,並且無法在不同任務中一致運用邏輯推理,或者妥善利用演算法,這種問題可能導致模型生成不符合事實或邏輯的資訊。

問題三:自我修正效率低

面對較簡單的問題時,大型推理模型會「過度思考」,儘管確定了正確答案,仍會花費資源探索錯誤的替代答案,導致表現不如一般的大型語言模型,而超過一定複雜程度的問題,模型完全無法找到正確答案,顯示大型推理模型有限的自我修正能力。

蘋果還指出,目前的評量方法主要集中在最終答案的準確性上,這些方法無法深入了解大詳推理模型內部推理過程的品質和結構,而幻覺問題正是源於這些缺陷,這使得僅檢視最終輸出結果無法找出問題。

值得一提的是,近來有越來越多的聲音認為,目前常用來檢測AI能力的基準測試,已經無法準確反應模型真正的性能。OpenAI共同創辦人安德烈.卡帕斯(Andrej Karpathy)今年4月就表示,「我現在真的不知道該看什麼指標了。」指出過往很棒的基準測試,已經難以讓他正確評量現在的模型能力。

打臉蘋果論文!實驗設計缺陷,讓AI智商被低估

不過,並不是所有人都認同蘋果發布的這項研究結果。慈善機構Open Philanthropy研究人員艾力克斯.勞森(Alex Lawsen)發表了一篇反駁文章《思考幻覺的幻覺》(The Illusion of the Illusion of Thinking), 聲稱蘋果這聳動的研究結果,實際上混淆了實驗設計上的缺陷與推理能力的限制。 Open Philanthropy是OpenAI的早期資助者,曾提供3,000萬美元資金。

Claude
Open Philanthropy研究人員利用Claude Opus 4等模型實測,反駁蘋果對於大型推理模型面對高複雜度問題會秀逗的說法。
圖/ shutterstoc

該反駁文章提到,他認為蘋果在解釋模型「崩潰」時,忽略了Token輸出上限, 例如在解8層或以上的河內塔問題時,模型會明確表示為了節省Token而停止輸出,是受到輸出長度限制而非無法推理。

蘋果使用自動化的流程評估模型輸出結果,無法正確區分推理失敗?還是Token不夠只能輸出部份結果?這些都被歸類為完全失敗。

他也指出,只要改變回答條件,讓大型推理模型有辦法在Token範圍內輸出結果後,Claude、Gemini以及o3等模型,可以輕易解開15層河內塔問題。

另外,反駁文章還聲稱,蘋果的渡河測試中包含了無解的問題。「模型得到零分並非因為推理失敗,而是因為正確辨識出無解的問題。」文章中寫道。

這篇反駁文章顯示,大型推理模型或許確實無法處理需要大量Token的邏輯問題,但並不像蘋果研究所示的那麼脆弱。

但勞森也承認AI在將學習到的知識運用在前所未見的狀況時,能力仍然有所侷限,他這篇文並不是想辯駁AI模型有多聰明,而是在宣佈推理崩潰前,我們需要更合理的評估標準。

延伸閱讀:OpenAI翻臉!跟金主微軟喬不攏持股比例,擬檢舉「反壟斷」逼微軟就範

資料來源:Mashable9to5macApple

責任編輯:李先泰

關鍵字: #蘋果 #AI #openai
往下滑看下一篇文章
資本市場迎來新氣象!簡立峰:從「臺灣人的亞洲」轉向「世界的亞洲」,主動招募國際互補性新創
資本市場迎來新氣象!簡立峰:從「臺灣人的亞洲」轉向「世界的亞洲」,主動招募國際互補性新創

金融監督管理委員會聯手臺灣證券交易所、證券櫃檯買賣中心共同推動「亞洲創新籌資平臺」,象徵臺灣資本市場邁向新局面。此平臺鎖定重點產業、法規鬆綁及強化推動策略等重點項目,面對此布局,擁有產業導師、獨立董事及投資者等多元角色的簡立峰,分享他的觀點與建議。

簡立峰開門見山直言,現在是臺灣資本市場加速前進的「好時機」。從量化角度來看,臺灣上市櫃公司總市值規模達94.9兆元,國家別排名全球第8名;特別是資通訊與半導體產業,目前已有四家企業(台積電、鴻海、台達電、聯發科)進入世界市值500大。受惠科技群山加持的優勢,讓打造「亞洲NASDAQ」的願景有厚實的底氣。

此外,簡立峰相當肯定本次針對創新版的制度優化,提供更鬆綁、具有創意的做法,大幅提高了國際團隊來臺上市的便利性。不過,除了擴大投資規模與流通性,簡立峰也提出三個策略觀點,鼓勵亞洲創新籌資平臺多家善用制度優勢,設定更宏大的發展目標。

觀點一:深化內部資本市場創新動能,鼓勵「小金雞」早期上市

這幾年臺灣的新創趨勢,簡立峰指出一個現象:現今成功的上市櫃案例,多半是大型集團的「小金雞」(子公司或孫公司),但集團通常傾向在小金雞獲利穩定並能確保控股後,才會在市場上釋出少數股份(25%)允許其上市。此情況容易造成臺灣的資本市場動能不足,甚至讓國際以為臺灣缺乏新創的誤解。

對此,簡立峰認為創新板的價值,即是鼓勵小金雞能提早登板的腳步,一來展現創新能量、翻轉產業典範;二來邁向資本市場不只是需要募資,更重要是上市後的經營策略,知道自身優勢所在,將營運方向隨時調整更貼近資本市場的需求。

因應簡立峰的觀察,本次創新板的新制,即是讓本國公司的股票集保期間從二年縮短為一年,並免除三年的承銷商保薦。此舉有助於降低集團小金雞提早進入市場的法規門檻,讓企業能更快速、更早實現「面對市場」的目標。

觀點二:強化產業聚落思維,主動招募國際上與臺灣互補的新創

亞洲創新籌資平臺成立的重要訴求之一,便是要成為亞洲NASDAQ。簡立峰直言,「如果是以此為願景,那它就不應該只是『臺灣人的亞洲』,而是成為『世界的亞洲』,也就是主動吸引更多國家的創新企業來臺上市,那麼招商策略必須從被動等待,轉為主動積極洽談。」

至於招商的目標該如何鎖定?簡立峰認為臺灣資本市場最重要的價值,在於其聚落現象,因此建議可瞄準能與臺灣產業有高度互補的區域國家或技術領域。讓臺灣的供應鏈業者與他們成為戰略夥伴關係,共同分享這些國外企業來臺上市後所創造的利潤。

如果是區域國家,簡立峰拿「以色列」為例,該國新創擁有強大的創意和軟硬整合能力,但缺乏生產製造基地,若考慮來臺灣上市或募資,將有利於他們與臺灣的製造商建立關係,增加其信賴度,並容易找到供應商。至於前瞻技術方面,簡立峰認為矽光子、3D封裝/先進封裝、AI資料中心冷卻等,與臺灣半導體產業有緊密合作關係,可借助資本市場吸引這些企業來臺投資、上市,不僅是實體的產業聚落,更有助於形成虛擬的資本市場聚落。

簡立峰的論述,也呼應亞洲創新籌資平臺鎖定的重點產業,涵蓋半導體、人工智慧、智慧製造、數位雲端、機器人、次世代通訊等前瞻新經濟領域。另外國際企業來臺上市的門檻,證交所也優化了既有制度,針對主要營運地或股東結構均未涉及陸港澳地區之外國企業,調整臺籍董事席次過半規範,僅須設置臺籍獨立董事至少二席。

觀點三:吸引國際分析師、產業媒體,成為亞洲NASDAQ絕佳觀測站

最後,簡立峰認為一個能持續有活水挹注的國際籌資平臺,成功上市是手段,但真正關鍵的目的,是能持續獲得投資並取得市場關注的聲譽。要獲得聲量,具體的執行策略是提高國際能見度,吸引國際級分析師的關注。

簡立峰以當時Appier在日本上市為例,他提到上市對Appier的最大益處並非來自本益比,而是被國際金融機構的分析師看到,並獲得他們的分析與報導。「這些報導對於B2B企業來說,是最紮實的行銷加分,能極大化取得業界客戶的信賴。」

簡立峰認為亞洲創新籌資平臺的下一步,可主動規劃一些登板的亮點案例,形成「標竿」進而產生群聚效應。對此,證交所回應未來將以多元行銷策略,配套措施包括加強外國公司資訊揭露,提高法人說明會的召開頻率,藉此提升企業國際知名度,為國際分析師提供更充足的資訊來源,助力更多指標的企業打響全球名氣。

國家發展委員會副主任委員詹方冠在亞洲創新籌資平臺啟動典禮上提到,臺灣經濟發展已從勞動密集、資本密集階段,進入到創新驅動的全新里程。最後簡立峰肯定表示,「亞洲創新籌資平臺的成立後,期待它的角色能槓桿資本市場的力量,讓『臺灣人的產業』轉變為『臺灣人主導的產業』,仰賴國際企業壯大臺灣的人才庫,同時也為臺灣創造新的經濟發展動能。」

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
一次搞懂Vibe Coding
© 2025 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓