誰在打臉誰?蘋果研究稱AI會「放棄思考」,反遭研究員抓包:把輸出限制當成推理失敗
誰在打臉誰?蘋果研究稱AI會「放棄思考」,反遭研究員抓包:把輸出限制當成推理失敗

OpenAI執行長山姆.奧特曼(Sam Altman)一向是廣為人知的AI樂觀論者,他近期的部落格專文指出,AI發展已經進入「溫和奇點」,亦即超級AI即將帶領人類起飛,從生產力到社會結構都會出現飛越式的躍升。

有趣的是,才辦完年度WWDC大會的蘋果,卻在近期發布一份研究報告,其中對「AI擅長思考」的說法大潑冷水,直言AI面對高複雜度問題仍然有其缺陷,「甚至不知道自己在說些什麼。」

一邊是端出殺手級應用的ChatGPT之父,另一邊則是近20年開啟智慧型手機世代的巨頭,為何他們對當前AI發展的看法如此極端?

蘋果:大型LLM遇到難題會「放棄思考」

蘋果在WWDC開發者大會前發表的一份研究《思考的幻覺》(The Illusion of Thinking)中,點名大型推理模型,在遇到過於複雜的問題時會「放棄思考」,減少投入的思考資源,無論是OpenAI的o1/o3、DeepSeek R1,還是Google 的Gemini Flash Thinking都是如此。

蘋果研究人員在實驗中測試了「河內塔」、跳棋問題和渡河問題(狐狸、雞、豆子)等經典益智題目。河內塔的目標是在三根柱子中,將不同大小的圓盤從一根柱子移動到另一根,同時遵守不能將大盤子放在小盤子上的規則。

這些都是相當經典、有一定邏輯的益智問題,只要掌握背後脈絡即使增加題目規模,例如更多的圓盤,人類仍能輕易解答,但大型推理模型到一定程度後,就會開始「秀逗」,無法正常解開題目,即使研究人員給予提示,讓模型按照演算法處理,也無法提昇準確度。

chatgpt shutterstock_2237655785.jpg
蘋果研究人員發現,大型推理模型遇到太複雜問題是會反常地減少投入思考資源。
圖/ shutterstock_2237655785.jpg

蘋果提到,在面對簡單問題時,大型語言模型表現優於大型推理模型;而中等複雜度問題時,大型推理模型會反過來展現優勢;但面對高複雜度問題時,兩種模型都會崩潰。

整體而言,蘋果研究人員在報告中指出了幾個問題:

問題一:準確度崩潰

當大型推理模型處理超過一定複雜度的任務時,準確性會大幅下降,甚至展現出反常的限制,即在擁有足夠資源的情況下,面對複雜任務反而減少推理資源投入,顯示當面對複雜問題時,模型可能無法有效推理,進而導致生成錯誤或憑空捏造──也就是幻覺。

問題二:無法精確計算

大型推理模型在執行精確計算上有著巨大的侷限,並且無法在不同任務中一致運用邏輯推理,或者妥善利用演算法,這種問題可能導致模型生成不符合事實或邏輯的資訊。

問題三:自我修正效率低

面對較簡單的問題時,大型推理模型會「過度思考」,儘管確定了正確答案,仍會花費資源探索錯誤的替代答案,導致表現不如一般的大型語言模型,而超過一定複雜程度的問題,模型完全無法找到正確答案,顯示大型推理模型有限的自我修正能力。

蘋果還指出,目前的評量方法主要集中在最終答案的準確性上,這些方法無法深入了解大詳推理模型內部推理過程的品質和結構,而幻覺問題正是源於這些缺陷,這使得僅檢視最終輸出結果無法找出問題。

值得一提的是,近來有越來越多的聲音認為,目前常用來檢測AI能力的基準測試,已經無法準確反應模型真正的性能。OpenAI共同創辦人安德烈.卡帕斯(Andrej Karpathy)今年4月就表示,「我現在真的不知道該看什麼指標了。」指出過往很棒的基準測試,已經難以讓他正確評量現在的模型能力。

打臉蘋果論文!實驗設計缺陷,讓AI智商被低估

不過,並不是所有人都認同蘋果發布的這項研究結果。慈善機構Open Philanthropy研究人員艾力克斯.勞森(Alex Lawsen)發表了一篇反駁文章《思考幻覺的幻覺》(The Illusion of the Illusion of Thinking), 聲稱蘋果這聳動的研究結果,實際上混淆了實驗設計上的缺陷與推理能力的限制。 Open Philanthropy是OpenAI的早期資助者,曾提供3,000萬美元資金。

Claude
Open Philanthropy研究人員利用Claude Opus 4等模型實測,反駁蘋果對於大型推理模型面對高複雜度問題會秀逗的說法。
圖/ shutterstoc

該反駁文章提到,他認為蘋果在解釋模型「崩潰」時,忽略了Token輸出上限, 例如在解8層或以上的河內塔問題時,模型會明確表示為了節省Token而停止輸出,是受到輸出長度限制而非無法推理。

蘋果使用自動化的流程評估模型輸出結果,無法正確區分推理失敗?還是Token不夠只能輸出部份結果?這些都被歸類為完全失敗。

他也指出,只要改變回答條件,讓大型推理模型有辦法在Token範圍內輸出結果後,Claude、Gemini以及o3等模型,可以輕易解開15層河內塔問題。

另外,反駁文章還聲稱,蘋果的渡河測試中包含了無解的問題。「模型得到零分並非因為推理失敗,而是因為正確辨識出無解的問題。」文章中寫道。

這篇反駁文章顯示,大型推理模型或許確實無法處理需要大量Token的邏輯問題,但並不像蘋果研究所示的那麼脆弱。

但勞森也承認AI在將學習到的知識運用在前所未見的狀況時,能力仍然有所侷限,他這篇文並不是想辯駁AI模型有多聰明,而是在宣佈推理崩潰前,我們需要更合理的評估標準。

延伸閱讀:OpenAI翻臉!跟金主微軟喬不攏持股比例,擬檢舉「反壟斷」逼微軟就範

資料來源:Mashable9to5macApple

責任編輯:李先泰

關鍵字: #蘋果 #AI #openai
往下滑看下一篇文章
思科:打造智慧轉型韌性基礎的關鍵 人才培育與科技
思科:打造智慧轉型韌性基礎的關鍵 人才培育與科技

人工智慧(AI)正以前所未有的姿態重塑全球政府與企業的數位轉型藍圖,帶來一場深刻的變革。這股浪潮不僅預示著效率與生產力的巨大躍升,同時也為組織帶來嚴峻挑戰。如何駕馭 AI、確保資訊安全、並同時兼顧永續發展,成為當今各國政府與企業亟需面對的核心課題。在這樣一個充滿挑戰與無限機會的時代,全球網路與資安科技大廠思科(Cisco),憑藉其完整的產業生態系和豐富的跨國合作經驗,正積極扮演關鍵的賦能者角色,所推動的台灣數位加速計畫(Taiwan Digital Acceleration, TDA)也已邁入3.0階段。思科認為,值此時刻組織需要為數位轉型建立具韌性的基礎,而關鍵不只是科技,更重要的是人才培育。

AI雖解決人力短缺問題 但人員更需學習駕馭AI

負責思科國家數位加速計畫(CDA),與多國政府密切合作的思科全球資深副總裁暨全球創新長Guy Diedrich,談到當今各國政府與企業正在面臨融合著AI、資安與永續發展的數位轉型趨勢,而在此過程中關鍵的是,組織必須透過科技與培育人才來為此波轉型打造具韌性的基礎。

思科
思科全球資深副總裁暨全球創新長Guy Diedrich
圖/ 思科

Diedrich進一步表示,未來的職位已不再是用職務說明書來衡量,而是以工作流程為核心,人力會在不同階段介接不同科技,可能是AI、機器人、人形機器人甚至量子電腦,因此人力與科技的整合也特別重要。思科台灣總經理林岳田也舉例,過去在地端、雲端網路設備有各自的管理平台,未來除了將化繁為簡整合為單一平台外,許多資料搜集比對的例行工作由AI取代,但關鍵的決策判斷仍會交由人力負責,因此培育員工學習AI也更加不可或缺。

過去從TDA 1.0計畫推動至今,透過思科網路學院(Cisco Networking Academy),思科與合作夥伴已經在台灣培育超過17萬名技術人才。提供從網路工程師認證(CCNA)、網路高級工程師(CCNP)到網路專家(CCIE)等,針對不同職務與層級完整的專業培訓,而去年剛推出針對AI架構的網路設計專家(CCDE-AI Infrastructure)認證,在市場上更是炙手可熱。Diedrich強調,未來學習將成為工作中的一部份,持續在職訓練才能確保人員跟上技術的快速發展。

林岳田也指出,思科致力於人才培育不遺餘力,並從多方面投注資源。包括目前已在台灣的北、南、東部區域成立思科網路學院教師培訓中心,作為推動各區域人才培訓的種子基地。同時,思科與合作夥伴晉泰科技在2025年於高雄成立「亞灣AIOT生態系發展基地暨研發中心」,目標是培育5,000名AIOT人才並協助 1,500 人取得國際認證,以解決目前產業智慧轉型卻求才若渴的窘境。而在政府公部門方面,思科近期與國家資通安全研究院 (簡稱「資安院」) 合作「NPO資安共學計畫」,由思科網路學院 (Cisco Networking Academy) 提供課程與平台資源,資安院負責在地招募與社群經營,共同構築永續的公益資安生態系。

思科
思科台灣總經理林岳田
圖/ 思科

完整生態系整合多元科技 一同推動AI創新

數位轉型另一項重要關鍵就是科技,尤其當今企業都在思考如何利用AI推動創新。思科與18家合作夥伴,從TDA 1.0到3.0計畫,共同實踐30個創新專案。其中TDA 1.0著重智慧城市、企業 5G專網、資訊安全和數位醫療照護等核心領域,奠定數位轉型基礎;TDA 2.0計畫除了延續並深化前述智慧城市與智慧交通,也因應新冠疫情下的醫療照護需求,為長者提供遠距學習、遠距醫療等樂齡生活應用,同時拓展金融韌性等創新場景。而在離岸風電計畫中,更利用5G結合VR眼鏡解決方案,協助當時因為疫情封控而無法來台支援的國外風機維護工程師,進行遠距教育訓練。

而TDA 3.0計畫中聚焦永續發展、資安韌性和AI驅動的智慧轉型,其中指標性專案之一,便是以高雄港為場域的智慧港口解決方案。提供從貨輪進港到貨櫃卸貨、起重機遠端操作監控等全自動化營運,可提升人員工作效率並確保安全。同時此方案中也兼顧永續發展需求,透過感測器可將各種機具設備的碳排資料回傳,完整監控能源使用情形。

人員短缺不只是運輸業也是許多產業共同面臨的難題,思科與合作夥伴針對醫院推出行動醫療推車,就是利用AIOT、無線/有線網路整合結合Webex視訊系統等,能協助遠端醫師迅速掌握病情,在第一時間提供專業判斷,或協助護理師迅速正確完成數據輸入工作。思科全球副總裁黃志明也強調,科技的運用更重要的是化繁為簡,透過整合算力、網路、資安與儲存功能的AI PODs一體機伺服器,讓許多TDA 3.0專案能專注於應用開發,加速落地部署。

黃志明進一步表示,思科能協助企業導入部署各項AI創新方案,得力於生態系中有擅長應用開發、技術架構、顧問諮詢等不同領域的合作夥伴,彼此在開放、包容的平台上運作,因此能協助企業加速智慧轉型並提升企業價值。

思科
思科全球副總裁黃志明
圖/ 思科

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
蘋果能再次偉大?
© 2025 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓