誰在打臉誰?蘋果研究稱AI會「放棄思考」,反遭研究員抓包:把輸出限制當成推理失敗
誰在打臉誰?蘋果研究稱AI會「放棄思考」,反遭研究員抓包:把輸出限制當成推理失敗

OpenAI執行長山姆.奧特曼(Sam Altman)一向是廣為人知的AI樂觀論者,他近期的部落格專文指出,AI發展已經進入「溫和奇點」,亦即超級AI即將帶領人類起飛,從生產力到社會結構都會出現飛越式的躍升。

有趣的是,才辦完年度WWDC大會的蘋果,卻在近期發布一份研究報告,其中對「AI擅長思考」的說法大潑冷水,直言AI面對高複雜度問題仍然有其缺陷,「甚至不知道自己在說些什麼。」

一邊是端出殺手級應用的ChatGPT之父,另一邊則是近20年開啟智慧型手機世代的巨頭,為何他們對當前AI發展的看法如此極端?

蘋果:大型LLM遇到難題會「放棄思考」

蘋果在WWDC開發者大會前發表的一份研究《思考的幻覺》(The Illusion of Thinking)中,點名大型推理模型,在遇到過於複雜的問題時會「放棄思考」,減少投入的思考資源,無論是OpenAI的o1/o3、DeepSeek R1,還是Google 的Gemini Flash Thinking都是如此。

蘋果研究人員在實驗中測試了「河內塔」、跳棋問題和渡河問題(狐狸、雞、豆子)等經典益智題目。河內塔的目標是在三根柱子中,將不同大小的圓盤從一根柱子移動到另一根,同時遵守不能將大盤子放在小盤子上的規則。

這些都是相當經典、有一定邏輯的益智問題,只要掌握背後脈絡即使增加題目規模,例如更多的圓盤,人類仍能輕易解答,但大型推理模型到一定程度後,就會開始「秀逗」,無法正常解開題目,即使研究人員給予提示,讓模型按照演算法處理,也無法提昇準確度。

chatgpt shutterstock_2237655785.jpg
蘋果研究人員發現,大型推理模型遇到太複雜問題是會反常地減少投入思考資源。
圖/ shutterstock_2237655785.jpg

蘋果提到,在面對簡單問題時,大型語言模型表現優於大型推理模型;而中等複雜度問題時,大型推理模型會反過來展現優勢;但面對高複雜度問題時,兩種模型都會崩潰。

整體而言,蘋果研究人員在報告中指出了幾個問題:

問題一:準確度崩潰

當大型推理模型處理超過一定複雜度的任務時,準確性會大幅下降,甚至展現出反常的限制,即在擁有足夠資源的情況下,面對複雜任務反而減少推理資源投入,顯示當面對複雜問題時,模型可能無法有效推理,進而導致生成錯誤或憑空捏造──也就是幻覺。

問題二:無法精確計算

大型推理模型在執行精確計算上有著巨大的侷限,並且無法在不同任務中一致運用邏輯推理,或者妥善利用演算法,這種問題可能導致模型生成不符合事實或邏輯的資訊。

問題三:自我修正效率低

面對較簡單的問題時,大型推理模型會「過度思考」,儘管確定了正確答案,仍會花費資源探索錯誤的替代答案,導致表現不如一般的大型語言模型,而超過一定複雜程度的問題,模型完全無法找到正確答案,顯示大型推理模型有限的自我修正能力。

蘋果還指出,目前的評量方法主要集中在最終答案的準確性上,這些方法無法深入了解大詳推理模型內部推理過程的品質和結構,而幻覺問題正是源於這些缺陷,這使得僅檢視最終輸出結果無法找出問題。

值得一提的是,近來有越來越多的聲音認為,目前常用來檢測AI能力的基準測試,已經無法準確反應模型真正的性能。OpenAI共同創辦人安德烈.卡帕斯(Andrej Karpathy)今年4月就表示,「我現在真的不知道該看什麼指標了。」指出過往很棒的基準測試,已經難以讓他正確評量現在的模型能力。

打臉蘋果論文!實驗設計缺陷,讓AI智商被低估

不過,並不是所有人都認同蘋果發布的這項研究結果。慈善機構Open Philanthropy研究人員艾力克斯.勞森(Alex Lawsen)發表了一篇反駁文章《思考幻覺的幻覺》(The Illusion of the Illusion of Thinking), 聲稱蘋果這聳動的研究結果,實際上混淆了實驗設計上的缺陷與推理能力的限制。 Open Philanthropy是OpenAI的早期資助者,曾提供3,000萬美元資金。

Claude
Open Philanthropy研究人員利用Claude Opus 4等模型實測,反駁蘋果對於大型推理模型面對高複雜度問題會秀逗的說法。
圖/ shutterstoc

該反駁文章提到,他認為蘋果在解釋模型「崩潰」時,忽略了Token輸出上限, 例如在解8層或以上的河內塔問題時,模型會明確表示為了節省Token而停止輸出,是受到輸出長度限制而非無法推理。

蘋果使用自動化的流程評估模型輸出結果,無法正確區分推理失敗?還是Token不夠只能輸出部份結果?這些都被歸類為完全失敗。

他也指出,只要改變回答條件,讓大型推理模型有辦法在Token範圍內輸出結果後,Claude、Gemini以及o3等模型,可以輕易解開15層河內塔問題。

另外,反駁文章還聲稱,蘋果的渡河測試中包含了無解的問題。「模型得到零分並非因為推理失敗,而是因為正確辨識出無解的問題。」文章中寫道。

這篇反駁文章顯示,大型推理模型或許確實無法處理需要大量Token的邏輯問題,但並不像蘋果研究所示的那麼脆弱。

但勞森也承認AI在將學習到的知識運用在前所未見的狀況時,能力仍然有所侷限,他這篇文並不是想辯駁AI模型有多聰明,而是在宣佈推理崩潰前,我們需要更合理的評估標準。

延伸閱讀:OpenAI翻臉!跟金主微軟喬不攏持股比例,擬檢舉「反壟斷」逼微軟就範

資料來源:Mashable9to5macApple

責任編輯:李先泰

關鍵字: #蘋果 #AI #openai
往下滑看下一篇文章
彰化,是活的!台灣設計展「圓未來之行」:以源創圓,看交通、建設、生活等多方面向,如何從300年中轉譯甦醒,令過去翻頁至今,創建未來!
彰化,是活的!台灣設計展「圓未來之行」:以源創圓,看交通、建設、生活等多方面向,如何從300年中轉譯甦醒,令過去翻頁至今,創建未來!

2025台灣設計展將開展!本次由彰化縣政府建設處 陳昌茂處長與策展人何來香,共同聊聊「圓未來之行」展覽與其背後的城市發展與公共建設,時代帶來了哪些蛻變與機會,彰化的未來,會是什麼模樣?陳昌茂處長談到:「先輕鬆聊聊彰化最為人知的印象吧,許多外地人提到彰化,就是控肉飯與肉圓,美食旅遊確實是大家的共同嗜好,但是否有其他的深度內容,能給大眾重新認識彰化的機會?『台灣設計展:圓未來之行』就是一個好契機。

圓未來之行,與城市一起成長:你所知道的彰化,它是什麼?

300年來的發展,彰化的農業與工業在國內甚至國際都佔有舉足輕重的角色,半工又半農的發展成了城市獨有特色,在行政區劃及地方制度的調整下,縣市間的城鄉差距造成了資源上的落差,因此,政府近年於交通、城市規劃與建設上積極推動許多計畫,此次的展覽為的就是讓民眾看見設計中與蛻變進行中的彰化,包含:彰化交流道的農業區解編、國民運動中心興建、規劃與建設八大生活圈轉運站及全國首創的長照衛福大樓等等,從交通、建設面改善實質生活,正是此次展覽核心,透過時代回顧轉譯為當代及未來發展能量,讓彰化充滿地方鮮活的發展魅力。」

策展人何來香說起,『台灣設計展:圓未來之行』以時間、轉譯、共創為展出主軸,將時間梳理成「過去─現在─未來」,包含:源(回顧記憶與成長記號)、緣(轉譯與生活)、圓(圓未來城市之貌)、合(共創未來),一如處長所說,將300年的背景梳理轉譯,在「交通、建設、生活」呈現,將其佈局為:三個室內展區X一個戶外展區,透過線上互動與實體呈現,讓彰化時代(過去─現在─未來)逐漸活起來,從低調走向鮮活光亮,「現在」,正是未來的縮影與定錨力量。

圖二.jpg
「圓未來之行」兩大重要推手:策展人何來香、彰化縣政府建設處陳昌茂處長。
圖/ 彰化縣政府

四大展區表述「三源一合」:未來可以被共創,一同設計理想的生活模樣

『台灣設計展:圓未來之行』共有四大展區,規劃為:源(記憶之源)、緣(轉譯之間)、圓(未來城市)、合(共創未來),同時串接著「時間:過去─現在─未來」的脈絡線,一覽城市的成長姿態。走進展區,開始從「過去」中逐漸甦醒,壓艙石、鐵道枕木等建材文物彷若時光倒流,將觀展者帶回記憶之源,透過佈局中的架構語言,從最微觀的建築元素開始見證曾經,呈現彰化的移居風光;來到「現在」,城市逐漸有了治理與變化,交通疏通了生活與流動,當下的建設創造了更多的「宜居」,像是:「共生共享」,表述著近年的建設成果,如:交通樞紐轉運站、伸港青年住宅、鹿江綠建築,以及老屋改造返鄉青年創業案例等,透過不同形式的交通、城市建設的延伸,以延續更多的綠化、永續、教育與建築示範及全齡照顧與幸福範例城市、共融場域等,舒展著彰化的此刻宜居。
而「未來」正在萌發的可能性,則以情境式劇場呈現城市建設藍圖,置身體驗充滿希望的願景,陪伴居民一起邁向未來。

圖三.jpg
員林市衛生所暨長照社福大樓新建工程拿下第23屆公共工程建築工程類金質獎,建築採全齡化無障礙、節能減碳設計。
圖/ 彰化縣政府

陳昌茂處長與策展人何來香提到,「未來城市」象徵著:綻放、圓滿、快捷與新鮮,展區整體風格呈現現代、乾淨、溫暖的未來感,此區域特別設計一個共創互動環節,以大尺度的城市規劃角度出發,邀請觀展者共同打造屬於彰化的未來城市,透過彰交特定區為城市共創背景,觀展者能透過平板互動,依需求、喜好選定主題類型與建築,如:該區域希望如何發展?公園綠地(共融公園、生態濕地)、產業經濟(百貨商場、研發大樓)、休閒育樂(美術館、圖書館等),民眾意見將由 AI 即時生成建築並影響城市發展指數,進而反思發展過程中經濟建設與生活環境的平衡取捨,最終會將互動成果整理成報告做為縣府施政參考,此區域的未來,將是共創而生的實驗計畫之一。而代表「合」的「戶外串聯區」,則是由在地師生以自然素材共創的「魚的肚子是我們的生活」,延伸探索永續、自然、未來想像及綠色療癒,令「圓未來之行」參與民眾跨域孩童到成人,擁抱接納多齡意見,讓想像活躍充滿新鮮生命力。

彰化的蛻變,是成長留下的獨特印記──未來,由我們共創

有趣的是,『台灣設計展:圓未來之行』本次展出地點為:彰化縣立鹿江國際中小學,它不僅是彰化首間公辦的雙語學校,也確定籌設高中部,以接軌國際的教育為目標。當展區中的時間(過去─現在─未來)與交通、建設、生活相互交融與牽連,讓每個時代的彰化,蛻變都因成長而留下獨特印記。從海洋(船運、通商)而生的彰化,在展覽中扣回海洋生態的共創溯源反思。

圖四.jpg
鹿江國際中小學新設高中部,預計117年學年度正式招生。
圖/ 彰化縣政府

陳昌茂處長認為,彰化的發展不必然要同於其他城市,當然也不會是其他城市的翻版,因為彰化有自己的專屬發展模式。期待透過此次展覽與共創,讓民眾與我們一起共同體驗最宜人與舒服的生活輪廓與幸福感受以及發掘彰化未來的無限發展可能;策展人何來香笑著分享,彰化是全球百大幸福城市的銀牌級城市,很期待各地民眾來參觀,重新感受彰化,並與群眾一同共創彰化。延續這樣的願景,彰化縣長王惠美也分享:「縣府其實一直在思考,如何擘劃下一個百年都市發展願景,讓民眾的生活變得更好,外移的人口逐漸回流。這些交通、城市建設的規劃、執行與聆聽大眾意見,都是為了一同探索未來、共同創造大家真正嚮往的生活」。

圖五.jpg
彰化縣長王惠美與縣府團隊積極規劃下一個百年都市發展願景,打造最宜居 幸福的城市。
圖/ 彰化縣政府

採訪・撰文/楊喻婷

【彰化縣政府 廣告】

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
一次搞懂Vibe Coding
© 2025 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓