AI變學霸?國二科學測驗已難不倒它,答對9成考題
AI變學霸?國二科學測驗已難不倒它,答對9成考題

4年前,由微軟共同創辦人保羅.艾倫(Paul Allen)設立的艾倫人工智慧研究所舉辦的一場賽事中,超過700位電腦學者競相開發能通過美國8年級科學考卷的人工智慧,勝者將能獲得8萬美元獎金,然而最終無一達成目標。

擁有常人所不能的知識量,過目不忘的AI,竟會被區區國、高中等級的考卷給難倒,或許很難讓人想像。但事實上證明,當時最先進、複雜的AI系統,連取得60分都有困難。因為不管學識含量再豐富,看不懂題目就一點意義也沒有了。

不過,最近的AI研究終於攻克阻礙,艾倫人工智慧研究所新推出的AI系統「Aristo」成功跨越了這道門檻。且絕不是低空飛過,AI在美國8年級科學測驗中答對9成題目;12年級科學測驗中,也有8成的答題正確率。

aristo
官方的介紹網站中,你甚至可親自考考Aristo,看看它是如何理解並解開問題。
圖/ Allen Institute for Artificial Intelligence

雖然這有一些「前提條件」──礙於目前AI系統的能力,研究人員刪除了與圖表、圖片有關的題目,因為這需要更高一層將語言理解、邏輯與電腦視覺結合的能力。

儘管如此,Aristo依舊深刻展現了人工智慧技術在理解語言脈絡、模擬人類決策邏輯上的重大進展。

打造「數位版亞里斯多德」,科學家讓AI寫考卷進步

早從2013年起,艾倫人工智慧研究所便著手開發Aristo,他們希望能打造出一個「數位版的亞里斯多德」,研究人員認為,比起傳統讓AI下棋的作法,給它們寫科學考卷更具訓練意義。

研究人員指出,對考題的理解並非依靠學習規則(learning rules)就能掌握的,需要AI運用邏輯連結不同事物之間的關聯性,好比說若森林大火增加,就可能造成果實、昆蟲的數量銳減,進而導致松鼠死亡。

aristo 2
人類一眼便能理解的簡單句子,AI需要進行複雜的處理過程。
圖/ Allen Institute for Artificial Intelligence

Aristo的基礎源自一套由Google建立,名為Bert的自然語言處理模型。在徹底研讀維基百科數千篇條目,以及大量浪漫小說、科幻小說與自行出版書籍後,Bert開始學會如何推測句子中闕漏的字詞。

藉由這項訓練,Bert學會了語言的基本建構方式,而研究人員則給予Bert更廣泛的問題與答案,漸漸地,它也學習到如何解答類似的問題。

雖然Aristo距離學者的終極目標:模擬人類智慧,還有一大段距離,目前展現的研究成果,已經足以開創商業應用上的潛力。研究所負責人奧倫.埃齊奧尼(Oren Etzioni)對此頗具信心,「我能說的是,你將見識新世代產品的誕生,部分源自新創,另一部分則源自大企業。」

這些自然語言處理模型,如今已成為許多研究項目的核心,例如用於識別假新聞的工具,以及聊天機器人使用的對話系統。水能載舟,亦能覆舟,也有人擔心,有辦法熟稔運用語言的AI,反倒可能助長假新聞散播。

無論如何,這項技術的潛力太過龐大,沒有人敢為其未來做出定論。另一間AI研究室Fast.ai研究人員傑瑞米.霍華德(Jeremy Howard)就表示,目前仍處於技術的早期階段,還未探索到其真正的潛力,這項技術最終將抵達何方,可能還沒有人知道。

日本開發「東Robo君」...可惜沒能突破東大門檻

在美國以外,世界各地也有不少科學家將AI研究的目光,放在做考卷身上。過去日本國立情報學研究所曾開發出AI機器人「東Robo君」,並以達到東大的入學標準為目標。

東robo君.png
連續4年落榜後,東Robo君不再挑戰考取東大。
圖/ DENSO東ロボ手くん NII「ロボットは東大に入れるか」成果発表会2016

不過在東Robo君連續4年落榜後,該機構最終於2016年中止了這個計畫,坦承AI的理解能力有限,只要遇到必須深入理解的問題,便立刻踢到鐵板,成績原地踏步的情況下,決定重新將重心移到提升AI的理解力上。

2017年時,中國也曾進行了一場AI與「學霸」們的高考數學比試,最終AI獲得134分,以1分之差惜敗精英學生組的成績平均,但仍向外界揭露AI在做考卷這檔事上,已經越來越上手。

責任編輯:林美欣

資料來源:New York TimesFast Company

關鍵字: #人工智慧
往下滑看下一篇文章
AI 同事愈來愈多怎麼管?Going Cloud 用「多代理系統」,助企業打造最強營運大腦
AI 同事愈來愈多怎麼管?Going Cloud 用「多代理系統」,助企業打造最強營運大腦

ChatGPT、Gemini、Claude 等 AI 通用工具問世後,「AI」無疑成了現今全球最熱門的關鍵字。儘管許多企業已經開始導入相關應用,多數卻仍停留在文書輔助、單一聊天機器人(Chatbot)運用等單點階段。但隨著商業環境快速變化、缺工日益嚴峻,企業需要的不再只是一個會回答問題的對話框,而是具備「自主決策與行動執行」能力的「代理式 AI」(Agentic AI)。

Going Cloud 和 IDC 合作發布的《多代理系統崛起 打造敏捷韌性企業》報告便指出,如今「AI First」時代來臨,企業的 AI 應用正從輔助性質走向自主營運,有 80% 的企業期望藉此提升生產力,70% 的企業希望能更輕鬆處理複雜任務,還有 66% 的企業期望透過多模型來提升整體效能。

代理式 AI 愈來愈多,必須納入組織管理

但究竟什麼是「代理式 AI」?

「過去人們使用生成式 AI 時,需要一步步下達明確指令,但現在使用者只要賦予代理式 AI(Agentic AI)明確目標,它就能自己理解前因後果、進行推演,甚至能去呼叫 API 完成任務。」Going Cloud 總經理黃柏淞點出差異。
而當企業內部的代理式 AI 日益增加,比方說,人資部門有專屬 AI、業務部門有報價 AI、法務部門有合約審閱 AI,跨部門協作的複雜度也隨之飆升,「如果你是管理者,你就會意識到,必須把 AI 當成一個人,納入組織裡來管理。」黃柏淞強調,能統籌、指揮多個 AI 代理協作的「多代理系統」(Multi-Agent System, MAS),正是為了解決這個痛點而生。

簡單來說,MAS 就像虛擬的企業總部,負責協調、治理負責不同任務的 AI 代理、工具和功能模組。在讓 AI 自主決策的同時,各個 AI 代理間也能共享資訊、協調分工。MAS 還具備極佳的擴展性和分散性,企業可以依照業務需求,隨時新增、更改 AI 代理,能大幅提升營運韌性。

雖然企業普遍意識到,代理式 AI 已經蔚為風潮,但實際部署時,仍面臨諸多挑戰。《多代理系統崛起 打造敏捷韌性企業》報告便顯示,資安疑慮、預算限制、缺乏 IT 支援分別是企業最擔憂的三大問題,「企業最擔心串聯多個 AI 代理時,要是權限沒控管好,很容易有機敏資料外洩的風險。」黃柏淞提到,在此情形下,Going Cloud 推出了以「分層式多代理架構」為核心的解決方案。系統會由一個「主管代理」(Supervisor Agent)作為主要決策層,底層則串聯了各個負責單一任務的「任務代理」(Task Agents)。

以 Going Cloud 服務的大型金融企業為例,假設一位 VIP 客戶登入銀行 APP,詢問 AI 客服:「我想申請房貸,請問現在利率多少?另外,請幫我評估把我目前的科技股基金贖回當作頭期款適不適合?」如果是傳統的聊天機器人,可能會因為問題太複雜直接轉接人工客服。但在 Going Cloud 的分層式 MAS 架構裡,「主管代理」接收到任務後,會先拆解再指派負責「房貸利率」的「任務代理」,去後台抓取客戶的信用評分和最新房貸專案。同時,這位虛擬主管還會指派「理財分析」的「任務代理」,去檢視客戶最近科技股基金的績效並預測市場。最後,再由「主管代理」統整資訊,一併給出一份完整且客製的財務建議,「分層式 MAS 能確保整個過程的指令被清楚傳遞,而且因為權限分層管理,房貸 Agent 不會碰到不該碰的理財資料,符合金融業的風險控管與合規要求。」黃柏淞說。

目前 Going Cloud 已經協助知名金融機構導入 MAS 架構。以實際成效來看,多代理客服平台能降低 50% 以上的人工客服工作負擔,並讓回覆使用者問題的平均時間減少 60% 以上;FAQ 知識導向與 API 資料調用的正確率,在調用得當的情況下,也都達到9成以上的成功率。黃柏淞指出,金融、製造、顧問等有複雜跨部門協作需求的大型企業,都是亟需採用代理式 AI 的產業。

#0 AI同事愈來愈多怎麼管?Going Cloud用「多代理系統」,助企業打造最強營運大腦
提到目前與台灣領先金融集團的合作進程,黃柏淞表示因為金融機構的特殊性,需要縝密的全方位服務,從前期討論到技術導入,大約需要半年到九個月的時間。
圖/ 數位時代

懂雲也懂企業痛點,助員工無痛升級「AI 小組長」

但為什麼 Going Cloud 能為企業打造出如此高效的代理式 AI 底層架構?一方面,Going Cloud 先前服務過亞洲最大 AI 多媒體科技集團科科科技(KKCompany Technologies),奠定具備理解和服務大型企業的經驗,且自 2022 年創立起,就鎖定服務架構最複雜的大型企業市場。同時,Going Cloud 是全台首家榮獲 AWS 生成式 AI 服務能力認證及 ISO27001、ISO27701 雙重國際驗證的雲端產業專家,此成就彰顯 Going Cloud 在堅實的資訊安全基礎上,深化了對個人資料保護的承諾,為客戶提供符合國際標準的資料保障,強化雲端服務領導地位。另外,Going Cloud 還能為企業量身打造底層 AI 平台,提供 AI 策略方針定調、雲端架構設計、Agent 任務規劃、效能優化等一站式服務。

對於準備跨入「AI 商用階段」的企業,黃柏淞建議,釐清應用場景,比追求最新技術更重要,「唯有清晰定義痛點,才能讓強大的 MAS 平台真正落地。」
他特別提到,導入 MAS 系統不只是 IT 部門的責任,其實更像企業的升級轉型,「未來的知識工作者,不能只是單純『接球就打』,每個人都將成為『小組長』或『專案經理』。」例如員工不必再親自打開 excel 敲公式、解讀報表,應該要學著指派手下的「數位同事」去執行。員工的核心價值,將從過去繁瑣、重複性任務的執行,轉移到前期的目標定義、流程規劃,以及後期的決策判斷和審核把關。

AI 技術飛速推進,企業間的競爭已從「要不要用 AI?」,升級成「如何管理與協作多個 AI?」。透過建構靈活、安全且具高擴展性的多代理系統,企業不僅能解放員工的生產力,更能在瞬息萬變的市場中,打造敏捷、韌性兼具的營運大腦。

登入數位時代會員

開啟專屬自己的主題內容,

每日推播重點文章

閱讀會員專屬文章

請先登入數位時代會員

看更多獨享內容

請先登入數位時代會員

開啟收藏文章功能,

請先登入數位時代會員

開啟訂閱文章分類功能,

請先登入數位時代會員

我還不是會員, 註冊去!
追蹤我們
AI全球100+台灣20
© 2026 Business Next Media Corp. All Rights Reserved. 本網站內容未經允許,不得轉載。
106 台北市大安區光復南路102號9樓